Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

  1. 7h ago

    【第738期】Rehearse:跨越自动研究中的信心悬崖

    今天的这篇的主题是: Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 自动研究(Autoresearch)通过提议修改、运行完整的训练任务以及保留能提升指标的修改,来改进机器学习代码。这一循环的效率不仅取决于产生构想,还取决于智能体在消耗一次训练运行之前,判断某项提议修改是否可能奏效的能力。我们研究了这种执行前判断(pre-execution judgment)的可靠性在自动研究轨迹的发展过程中是如何变化的。在公开的 AutoSOTA 日志(Li et al., 2026; Tsinghua FIB Lab, 2026)中,有益修改的比例从前两轮迭代中的 70% 下降到了第 6 轮及以后的 43%。在来自 39 个源自论文的 AutoSOTA 任务的 296 对同基线修改对(每对包含一个提升了指标的修改和一个未提升的修改,且隐去了实际测得的结果)中,一个在获得候选推理过程(rationales)但未获得先前尝试历史的情况下,给出严格共识裁决的 LLM 裁判准确率达到了 79.5%。然而,在包含 366 个修改对的完整基准测试中,这种能力在循环的后期大幅削弱。随着成功修改的累积,选择性准确率(selective accuracy,即以严格共识裁决为条件的准确率)从 82.8% 降至 56.9%,而裁判依然倾向于做出裁决。我们将这种运行模式称为置信度悬崖(confidence cliff)。《Rehearse》将这种循环改进实现为一种用于自动研究循环的轻量级技能:提议多个构想,在执行前对其进行比较,运行最富前景的构想,并结合针对类似过往尝试与结果的专注记忆进行裁判。这种专注的结果记忆将后期的选择性准确率提升至 83.5%。在跨越三个循环、包含 4,000 个预算内训练运行的测试中,在相同的训练运行预算下,《Rehearse》提升了 nanochat、图像分类和时间序列预测任务的终点性能。 原文链接:https://arxiv.org/abs/2607.27687 前往小宇宙评论区与主播互动

  2. 1d ago

    【第737期】提示词引起的编码代理效能损耗研究-请反复确认竟让AI贵18倍

    今天的这篇的主题是: Same Task, Different Work: Prompt-Induced Waste in Coding Agents A Preregistered Study of Reasoning, Tools, and Harnesses Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 代码智能体(coding-agent)的效率不能仅凭 Token 数量或模型价格来表征。端到端成本和任务成功率共同取决于提示词语义、推理开销(inference effort)、框架策略(harness policy)、模型、任务难度、工具使用、上下文管理以及供应商的计费方式。对照实验表明,提示词的措辞可以在不改变任务的前提下改变推理与验证行为;额外的推理开销虽然能对困难任务有所帮助,但也会在不产生任何效益的情况下增加成本;并且当框架发生变化时,某项效率干预措施的价值也可能随之改变。这些结果表明,提示词、推理开销和框架是相互作用的实验因素,而非彼此独立的控制变量。我们将效率建模为由智能体轨迹所引发的“单个成功任务的成本”。Token 和缓存数量是该轨迹的度量指标,而非充分的优化目标。因此,智能体评估应当在控制决定轨迹生成方式的系统变量的同时,测量成功率和端到端成本。 原文链接:https://arxiv.org/abs/2608.01347 前往小宇宙评论区与主播互动

  3. 2d ago

    【第736期】DataSpace:多模态异构工作空间数据智能体基准测试

    今天的这篇的主题是: DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 数据智能体(Data agents)使得跨组织工作空间进行自然语言分析成为可能,而在这些空间中,相关证据可能分散在数据库、结构化文件、长文档和多媒体中。现有的基准测试在很大程度上孤立了结构化查询、检索或开放式分析,导致异构证据发现、完整的表格输出以及确定性评估之间缺乏充分统一。我们提出了 DataSpace,这是一个让数据智能体从任务局部的异构工作空间中生成可验证表格结果的基准测试。它包含 410 个跨语言任务和 7,439 个构件(artifacts),涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频,总计 15.01 GB。DataSpace 还作为 KDD Cup 2026“用于复杂数据分析的数据智能体”竞赛的官方评估基准。每个智能体仅接收一个问题和工作空间,并返回请求的完整表格结果。我们使用 DataSpace-Builder 构建了 DataSpace,这是一个基于执行的框架,包含跨语言转换、约束感知关系采样、模态路由与构件渲染,以及由 11 位领域专家进行的人工审查与任务修复。确定性评估器执行表头无关的列对齐、类型与精度感知的归一化,以及顺序感知的行比较。在对 6 个最新发布的前沿多模态模型和 5 个广泛使用的智能体框架(harnesses)进行的评估中,最高准确率达到了 66.34%,而在主干模型固定的情况下,框架的选择产生了 15.36 个百分点的差距。多模态证据集成与连接(joins)一致降低了所有 6 个主干模型的准确率。这些结果表明 DataSpace 仍未饱和,并指出了提升数据智能体可靠性的关键挑战。 原文链接:https://arxiv.org/abs/2608.03451 前往小宇宙评论区与主播互动

  4. 3d ago

    【第735期】Harness-R1让AI不改参数自动纠错

    今天的这篇的主题是: Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 围绕大语言模型构建的智能体在部署过程中会不断累积交互轨迹,但它们的行为通常保持固定。除了更新模型权重之外,这些轨迹还可以用来改进用于构建上下文、中介工具、验证动作以及恢复执行的智能体框架(harness)。我们提出了 Harness-R1,据我们所知,这是首个将对现有可执行运行时的“基于失败条件的全生命周期编辑”转化为一项可学习能力的方法。它通过在线强化学习对专门的框架工程师(harness engineer)进行后训练,使其做出的修改能根据其产生的实际任务成功率进行优化,而非由固定的编辑器直接提议。一个独立的 9B 工程师将目标智能体的批量失败转化为经过验证的可执行补丁;对冻结的目标智能体进行同批次的新一轮运行可提供结果奖励,因此训练仅更新工程师。冷启动监督微调初始化了这一编辑策略,随后通过组相对策略优化(GRPO)对其进行在线训练。在 WebShop、ALFWorld 和 DBBench 基准测试中,Harness-R1 将原生 Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%(提高了 9.3 个百分点)。在对目标智能体进行直接微调后,特定于目标智能体的工程师将平均成功率从 59.2% 进一步提升至 64.2%(提高了 5.0 个百分点);由于无论是在微调目标智能体之前还是之后,这些收益均能保持,Harness-R1 为框架工程师与目标智能体的协同演化(co-evolving)指明了方向。 原文链接:https://arxiv.org/abs/2608.02276 前往小宇宙评论区与主播互动

  5. 4d ago

    【第734期】采样胜过反思:同等词元预算下的推理评估

    今天的这篇的主题是: Sample More, Reflect Less Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 让语言模型制定计划、批判并重写自身的回答、反思错误、从多次尝试中挑选最佳方案或与自身的副本进行辩论的方法,几乎都会使其生成比单条思维链(chain of thought)多得多的文本。由于仅通过生成更多文本本身就能提高准确率,因此相比单条思维链获得的性能提升并不能证明是该方法的核心构想发挥了作用。Wang 等人 (2024) 曾报告称,一旦控制预算相当,重复对同一个问题进行采样并保留最常见答案的简单基线往往能胜出,但该研究仅给出了点估计,缺乏置信区间或显著性检验。 我们将该比较重构为一项专门设计的实验:涵盖 7 种方法、参数量为 1.5B、3B 和 7B 的开源模型,以及两个数学基准测试(各含 150 道题目)。我们统计了生成的每一个 Token(包括用于批判、反思、辩论轮次和校验所消耗的 Token),并在各自实际测得的成本下,将每种方法与重复采样进行对比。所有 36 组对比均按问题进行了配对,并采用了 Self-bootstrap 采样区间与多重性修正(multiplicity correction)。 在相同成本下,没有任何方法在任何情况下能可靠地优于重复采样。有 10 组对比的结果可靠地更差,它们全部属于模型检查自身输出的方法,且所有 18 组自我检查(self-inspection)对比均为负向结果。随着模型规模的扩大,两类自我检查方法表现出了不同的走势。选择策略不再具有伤害性:取 Best-of-N 的 8 个样本并仅统计最常见的答案,在 1.5B 模型上比让模型自行挑选分别高出 8.0 和 11.3 个百分点,但在 7B 模型上仅高出 2.0 和 1.3 个百分点,与零相比已无法区分。重写策略则未能恢复:在 7B 模型上,Self-Refine 与强制 Reflexion 仍比基线低 3.6 到 10.1 个百分点。 原版论文中所发表的 Reflexion 在最小的模型上从未触发过自身的重试机制。它每次都判定自己是正确的,从而默默地退化为了单条思维链。我们公开了代码、提示词、所有生成内容以及我们的验证脚本。 原文链接:https://arxiv.org/abs/2607.28576 前往小宇宙评论区与主播互动

  6. 5d ago

    【第733期】Zero-Mem:零令牌智能体存储系统

    今天的这篇的主题是: Zero-Mem: Zero-Token Memory Operations for LLM Agents Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary LLM 智能体(LLM agents)需要记忆才能在漫长的交互过程中保持行为一致,然而许多系统却依赖额外的 LLM 调用来运行该记忆机制。生成中间记录并中介其检索会增加持续发生的 Token 和时间成本,而遗漏或合并的细节可能会掩盖原始证据。我们探讨结构化记忆访问是否根本不需要进行生成。《Zero-Mem》引入了零 Token 记忆操作(zero-token memory operations):除了最终的问答环节外,没有任何步骤会调用 LLM,也不会消耗 LLM 的输入或输出 Token;编码器(encoder)的计算则单独统计。《Zero-Mem》将原始交互轨迹保留为其记录来源。它以两种互补的方式组织这些轨迹:实体-上下文图暴露了跨交互的关联,而时间层级结构则保留了对话的局部性(locality)与会话状态。对于每个查询,《Zero-Mem》权衡这两种视角,同时从中检索,并顺应其结构来恢复支撑性关系或周边上下文。确定性校准(deterministic calibration)首先剔除冲突的证据,进而确保阅读器(reader)的回答严格锚定于检索到的轨迹。只有负责最终问答的阅读器才会调用 LLM。在长记忆(long-memory)与长上下文问答基准测试中,《Zero-Mem》在消除记忆操作中的 LLM 调用及 LLM Token 消耗的同时,取得了具备竞争力的性能。在相同的最终问答阅读器和上下文预算下,相较于最快的对比基线,它将记忆操作的时间成本降低了 57.6%。消融实验证实了这两种视角及其依赖于查询的协调机制所做出的贡献。总体而言,结果表明结构化智能体记忆无需生成过去信息的中间表示。经过同行评审后,代码和实现细节将在该 https 链接处公布。 原文链接:https://arxiv.org/abs/2607.29377 前往小宇宙评论区与主播互动

    【第733期】Zero-Mem:零令牌智能体存储系统
  7. 6d ago

    【第732期】智能体故障定位的交互中心分类法

    今天的这篇的主题是: Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 现有评估通常将智能体(agent)的失败归结为系统层面的结果,掩盖了故障的始发位置以及哪种干预措施能够改进智能体系统。这就引发了一个“修复分配问题”(repair-assignment problem):相同的显性失败可能因其根源不同,分别需要模型后训练(post-training)、框架工程(harness engineering)、环境重构或基准测试修复。由于智能体行为是由模型、框架、用户、工具、记忆和环境之间的相互作用涌现而来的,因此结果层面的标签通常不足以指导改进。大多数失败分类法对解决这一问题的帮助微乎其微,因为它们依赖于特定的基准测试且缺乏统一的结构。我们提出了一种以交互为中心的分类法(interaction-centric taxonomy),该方法将失败准确定位至其发生的交互过程,并识别出相应的责任组件。该分类法整理了 41 种失败模式,将每种模式分别归属于两个组件之间的连接边,并指定了指示修复归属的故障方(fault side)。这使得该分类法具备了可操作性:模型侧的失败指明了后训练的目标;框架侧的失败指向了脚手架(scaffolding)与工具集成的修复;而环境或评分器(grader)的失败则揭示了需要重新设计的评估条件。该模式适用于各种智能体架构,从代码助手到长流程个人助手以及多智能体系统。我们通过来自公开基准测试、模型系统卡(system cards)、已发表报告和记录的智能体轨迹中的具体示例对该分类法进行了奠基,并使用独立的推理智能体作为裁判评估了其可复现性。在涵盖 4 个前沿模型的测试中,最强裁判对人类类别标签的一致性系数达到了 Cohen's κ=0.76,这表明这些类别捕捉到了公认的结构特征,而非特定标注者的偏好。 原文链接:https://arxiv.org/abs/2607.28802 前往小宇宙评论区与主播互动

  8. Sep 30

    【第731期】AgentThread:大模型代理协议的形式化安全分析与验证

    今天的这篇的主题是: Formal Security Analysis of Agent Protocol Composition Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary AI 智能体协议定义了智能体如何使用工具、委托工作以及在不同软件系统间进行协调,但它们的安全需求仍不完善,且在不同部署中的执行情况也并不一致。我们提出了 AgentThread,这是一个源链式(source-linked)框架,用于对智能体协议进行从规范文本到运行中 SDK 的安全保证分析。AgentThread 贡献了一个分层的安全范畴,将源自协议的检查形式化为 TLA+ 约束不变式,并提供了一个双阶段检查器——该检查器能将协议规范编译为可进行模型检验的模型,并通过协议适配器针对真实 SDK 重放可执行的反例。对于每一项发现,AgentThread 都会记录检查背后的源文本,并将被违反的协议需求与缺失的建议、加固缺陷以及未分配的跨协议责任区分开来。 在涵盖 5 个新兴智能体协议的测试中,AgentThread 识别出了 35 个规范层面的发现,通过对生产级 SDK 和参考服务器进行的 80 个实现测试对其提供了支持,并发现了仅在协议组合下才会出现的 30 个额外失效案例。我们进一步表明,实际上仅有一个协议执行了与安全相关的控制,且没有协议为跨协议行为分配执行责任。因此,智能体协议的不安全性不仅是一个规范或实现问题,也是跨协议、SDK 和部署的责任鸿沟。 原文链接:https://arxiv.org/abs/2606.28690 前往小宇宙评论区与主播互动

About

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。