Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

  1. 16h ago

    【第734期】采样胜过反思:同等词元预算下的推理评估

    今天的这篇的主题是: Sample More, Reflect Less Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 让语言模型制定计划、批判并重写自身的回答、反思错误、从多次尝试中挑选最佳方案或与自身的副本进行辩论的方法,几乎都会使其生成比单条思维链(chain of thought)多得多的文本。由于仅通过生成更多文本本身就能提高准确率,因此相比单条思维链获得的性能提升并不能证明是该方法的核心构想发挥了作用。Wang 等人 (2024) 曾报告称,一旦控制预算相当,重复对同一个问题进行采样并保留最常见答案的简单基线往往能胜出,但该研究仅给出了点估计,缺乏置信区间或显著性检验。 我们将该比较重构为一项专门设计的实验:涵盖 7 种方法、参数量为 1.5B、3B 和 7B 的开源模型,以及两个数学基准测试(各含 150 道题目)。我们统计了生成的每一个 Token(包括用于批判、反思、辩论轮次和校验所消耗的 Token),并在各自实际测得的成本下,将每种方法与重复采样进行对比。所有 36 组对比均按问题进行了配对,并采用了 Self-bootstrap 采样区间与多重性修正(multiplicity correction)。 在相同成本下,没有任何方法在任何情况下能可靠地优于重复采样。有 10 组对比的结果可靠地更差,它们全部属于模型检查自身输出的方法,且所有 18 组自我检查(self-inspection)对比均为负向结果。随着模型规模的扩大,两类自我检查方法表现出了不同的走势。选择策略不再具有伤害性:取 Best-of-N 的 8 个样本并仅统计最常见的答案,在 1.5B 模型上比让模型自行挑选分别高出 8.0 和 11.3 个百分点,但在 7B 模型上仅高出 2.0 和 1.3 个百分点,与零相比已无法区分。重写策略则未能恢复:在 7B 模型上,Self-Refine 与强制 Reflexion 仍比基线低 3.6 到 10.1 个百分点。 原版论文中所发表的 Reflexion 在最小的模型上从未触发过自身的重试机制。它每次都判定自己是正确的,从而默默地退化为了单条思维链。我们公开了代码、提示词、所有生成内容以及我们的验证脚本。 原文链接:https://arxiv.org/abs/2607.28576 前往小宇宙评论区与主播互动

  2. 1d ago

    【第733期】Zero-Mem:零令牌智能体存储系统

    今天的这篇的主题是: Zero-Mem: Zero-Token Memory Operations for LLM Agents Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary LLM 智能体(LLM agents)需要记忆才能在漫长的交互过程中保持行为一致,然而许多系统却依赖额外的 LLM 调用来运行该记忆机制。生成中间记录并中介其检索会增加持续发生的 Token 和时间成本,而遗漏或合并的细节可能会掩盖原始证据。我们探讨结构化记忆访问是否根本不需要进行生成。《Zero-Mem》引入了零 Token 记忆操作(zero-token memory operations):除了最终的问答环节外,没有任何步骤会调用 LLM,也不会消耗 LLM 的输入或输出 Token;编码器(encoder)的计算则单独统计。《Zero-Mem》将原始交互轨迹保留为其记录来源。它以两种互补的方式组织这些轨迹:实体-上下文图暴露了跨交互的关联,而时间层级结构则保留了对话的局部性(locality)与会话状态。对于每个查询,《Zero-Mem》权衡这两种视角,同时从中检索,并顺应其结构来恢复支撑性关系或周边上下文。确定性校准(deterministic calibration)首先剔除冲突的证据,进而确保阅读器(reader)的回答严格锚定于检索到的轨迹。只有负责最终问答的阅读器才会调用 LLM。在长记忆(long-memory)与长上下文问答基准测试中,《Zero-Mem》在消除记忆操作中的 LLM 调用及 LLM Token 消耗的同时,取得了具备竞争力的性能。在相同的最终问答阅读器和上下文预算下,相较于最快的对比基线,它将记忆操作的时间成本降低了 57.6%。消融实验证实了这两种视角及其依赖于查询的协调机制所做出的贡献。总体而言,结果表明结构化智能体记忆无需生成过去信息的中间表示。经过同行评审后,代码和实现细节将在该 https 链接处公布。 原文链接:https://arxiv.org/abs/2607.29377 前往小宇宙评论区与主播互动

    【第733期】Zero-Mem:零令牌智能体存储系统
  3. 2d ago

    【第732期】智能体故障定位的交互中心分类法

    今天的这篇的主题是: Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 现有评估通常将智能体(agent)的失败归结为系统层面的结果,掩盖了故障的始发位置以及哪种干预措施能够改进智能体系统。这就引发了一个“修复分配问题”(repair-assignment problem):相同的显性失败可能因其根源不同,分别需要模型后训练(post-training)、框架工程(harness engineering)、环境重构或基准测试修复。由于智能体行为是由模型、框架、用户、工具、记忆和环境之间的相互作用涌现而来的,因此结果层面的标签通常不足以指导改进。大多数失败分类法对解决这一问题的帮助微乎其微,因为它们依赖于特定的基准测试且缺乏统一的结构。我们提出了一种以交互为中心的分类法(interaction-centric taxonomy),该方法将失败准确定位至其发生的交互过程,并识别出相应的责任组件。该分类法整理了 41 种失败模式,将每种模式分别归属于两个组件之间的连接边,并指定了指示修复归属的故障方(fault side)。这使得该分类法具备了可操作性:模型侧的失败指明了后训练的目标;框架侧的失败指向了脚手架(scaffolding)与工具集成的修复;而环境或评分器(grader)的失败则揭示了需要重新设计的评估条件。该模式适用于各种智能体架构,从代码助手到长流程个人助手以及多智能体系统。我们通过来自公开基准测试、模型系统卡(system cards)、已发表报告和记录的智能体轨迹中的具体示例对该分类法进行了奠基,并使用独立的推理智能体作为裁判评估了其可复现性。在涵盖 4 个前沿模型的测试中,最强裁判对人类类别标签的一致性系数达到了 Cohen's κ=0.76,这表明这些类别捕捉到了公认的结构特征,而非特定标注者的偏好。 原文链接:https://arxiv.org/abs/2607.28802 前往小宇宙评论区与主播互动

  4. 3d ago

    【第731期】AgentThread:大模型代理协议的形式化安全分析与验证

    今天的这篇的主题是: Formal Security Analysis of Agent Protocol Composition Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary AI 智能体协议定义了智能体如何使用工具、委托工作以及在不同软件系统间进行协调,但它们的安全需求仍不完善,且在不同部署中的执行情况也并不一致。我们提出了 AgentThread,这是一个源链式(source-linked)框架,用于对智能体协议进行从规范文本到运行中 SDK 的安全保证分析。AgentThread 贡献了一个分层的安全范畴,将源自协议的检查形式化为 TLA+ 约束不变式,并提供了一个双阶段检查器——该检查器能将协议规范编译为可进行模型检验的模型,并通过协议适配器针对真实 SDK 重放可执行的反例。对于每一项发现,AgentThread 都会记录检查背后的源文本,并将被违反的协议需求与缺失的建议、加固缺陷以及未分配的跨协议责任区分开来。 在涵盖 5 个新兴智能体协议的测试中,AgentThread 识别出了 35 个规范层面的发现,通过对生产级 SDK 和参考服务器进行的 80 个实现测试对其提供了支持,并发现了仅在协议组合下才会出现的 30 个额外失效案例。我们进一步表明,实际上仅有一个协议执行了与安全相关的控制,且没有协议为跨协议行为分配执行责任。因此,智能体协议的不安全性不仅是一个规范或实现问题,也是跨协议、SDK 和部署的责任鸿沟。 原文链接:https://arxiv.org/abs/2606.28690 前往小宇宙评论区与主播互动

  5. 4d ago

    【第730期】InterSAGE:智能体互联网的安全性与可验证互操作协议

    今天的这篇的主题是: InterSAGE: The Secure and Verifiable Interoperability Protocol for An Internet of Agents Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 新兴的智能体互联网(Internet of Agents)使基于大语言模型的智能体能够跨越组织边界发现同行、调用工具并委托任务。现有协议越来越多地定义了智能体之间如何交换消息,但并未定义智能体在委托发生后如何证明其身份、授权、宣称的能力或责任归属。我们提出了 InterSAGE,这是一个信任原生的协议套件,它与通信协议并行提供(而非取代)了这一缺失的安全底层。InterSAGE 由四个层级组成:持久身份、发现、信任协商与责任归属。其四大核心原语为:(1)绑定开发者、代码包、运算符和部署上下文的智能体身份卡;(2)使用绑定 DID 的可验证凭证清单进行具备能力感知的发现;(3)将单调能力衰减与双层访问控制相结合的信任协商;以及(4)在无需共识账本的情况下,将使用情况、委托和执行轨迹绑定至智能体身份的内核介导加密审计轨迹。InterSAGE 旨在对 MCP、A2A、ANP 和 AG-UI 进行补充,使通信协议能够独立演进,同时保持信任语义的明确性、可移植性和可验证性。我们将 InterSAGE 与涵盖智能体协议、去中心化身份、OAuth/OIDC 扩展、零信任治理、委托及审计架构的 50 多项相关工作进行了比较。我们表明,先前的架构中没有一种能够将持久身份、能力感知发现、信任协商和责任归属作为统一的四层信任底层来共同执行,以实现安全的智能体互操作性。 原文链接:https://arxiv.org/abs/2608.13030 前往小宇宙评论区与主播互动

  6. 5d ago

    【第729期】Agent文件系统代理存储:组织、演化与可持续性研究

    今天的这篇的主题是: Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 部署的 LLM 智能体(LLM agents)越来越倾向于将长期记忆以文件系统的形式保存:一个由 Markdown 文件组成的目录树,智能体自身通过通用的文件工具进行读取、写入和重组。然而,学术研究在很大程度上忽略了这一介质:先前的系统通常设计定制化的记忆表示形式并针对其研究检索,使得默认方案的两个关键假设未经检验:即随着记忆的累积、冲突和过时,智能体能够保持一个不断增长的存储库处于有序状态;以及这种组织方式确实能带来收益。本文对基于文件系统的智能体记忆进行了首次系统性探索。我们将该场景正式化为一个围绕单一记忆文件系统展开的三重角色模型:管理智能体负责整合并组织传入的内容,检索智能体负责使用引用来源回答查询,执行智能体则提供任务轨迹并将其提炼为技能,从而在单个存储库中统一了声明性记忆与技能。在长对话基准和具身任务中,随着记忆的增长,我们改变了记忆形态(智能体组织的层级结构、逐字转储、块检索)、流规模、工具套件(沙盒 Shell、记忆工具风格的函数、多样化的搜索工具)以及管理与检索智能体的能力,同时跟踪回答质量、成本和存储库的健康状况。有序组织能可靠带来的优势是搜索经济性:在资料规模庞大时,有序的存储库能使检索成本降低约一半。然而,当今的智能体未能实现默认方案的承诺:在我们的增长研究中,除了最强的管理智能体之外,所有智能体的组织结构都会发生侵蚀;并且我们测试的所有智能体都未能将组织本身转化为更好的回答质量。此外,模型并非决定存储库形态的唯一杠杆:仅更换工具集就能对存储库形态产生与更换模型同样强烈的重塑作用。本研究将文件系统这一默认方案从一项盲目的假设转变为智能体记忆的设计空间。 原文链接:https://arxiv.org/abs/2607.26637 前往小宇宙评论区与主播互动

    【第729期】Agent文件系统代理存储:组织、演化与可持续性研究
  7. 6d ago

    【第728期】ACM:面向长时任务的自主语境管理框架

    今天的这篇的主题是: ACM: Agentic Context Management for Long Horizon Tasks Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary Agent 化任务在本质上具有长视角(long-horizon)与多轮交互的特点,会在与环境的互动中不断积累上下文。现有的上下文压缩方法不可避免地会带来信息损失,并且通常由僵化的启发式规则触发,导致它们无法与 Agent 动态演进的推理焦点保持对齐。 我们提出了 Agentic Context Management(ACM,Agent 化上下文管理),这是一个为 Agent 配备专用上下文编辑工具以实现无损上下文管理的框架。受人类短时记忆与长时记忆相互作用的启发,Agent 能够自主决定何时压缩其上下文,将废弃的内容卸载(offload)至外部记忆系统,并在后续需要时根据检索需求对其发起查询。 基于该框架,我们进一步开发了一个后训练(post-training)流水线,用于构建高质量的上下文管理演示数据,并提升模型在 Agent 化搜索与编程任务上的性能。深入分析表明,有效的上下文管理能够减轻峰值 token 压力,支持更深入长久的探索,并在独立试验中产生更加稳定一致的解决方案。代码、数据和模型 Checkpoints 已在该 URL(this https URL)处提供。 原文链接:https://arxiv.org/abs/2607.23809 前往小宇宙评论区与主播互动

  8. Sep 26

    【第727期】JAXBench:自主TPU内核优化评测基准

    今天的这篇的主题是: JAXBench: Benchmarking Autonomous TPU Kernel Optimization Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 严格的基准测试通过确立可供攀登的共同目标,推动了自主 GPU 内核性能优化领域的进步,但 TPU 领域尚无同等效力的基准。我们推出了 JAXBench,这是一个在 Google Cloud TPU 上用于 AI 生成内核优化的 TPU 原生基准测试套件。 JAXBench 包含 50 个既具备实际相关性又留有优化空间(headroom)的 JAX 工作负载。我们从公共 MaxText 库中的架构(如 Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2 和 AlphaFold2)中提取了 17 个生产级 ML 算子,并从 KernelBench 中翻译了 33 个经正确性验证的算子,同时设置了能够实现高 TPU v6e MXU 利用率的新问题规模。在 17 个生产级算子中,有 8 个附带了来自公共 Tokamax 库且经过分块大小调优(block-size tuned)的手工优化 Pallas 内核,以确立专家级上限基线。 我们评估了四种基于反馈的方法在为 JAXBench 生成候选 Pallas 内核上的表现。在配合 Gemini 3 Flash 的全套基准测试中,我们发现对于像 Pallas 这样缺乏丰富文档的 DSL 而言,特定于目标的上下文比模型规模更为关键。提供精心挑选的 TPU 文档上下文,可将单样本正确率(per-sample correctness)从 5.8% 提升至 37.3%,并在 50 个基准测试中解决了 48 个,实现了 1.28 倍的几何平均加速比。 一旦实现正确性,搜索结构就会带来显著收益:Autocomp 的束搜索(beam-search)流水线相比 XLA 达到了 1.36 倍的几何平均加速比。在 8 个手工调优的内核上,Autocomp 相比 XLA 取得了 1.60 倍的几何平均加速比,恢复了 Tokamax 2.08 倍上限的大部分性能,但在专用的分页(paged)和不规则(ragged)注意力算子方面仍稍显逊色。 高质量的 TPU 内核优化仍是一项极具挑战性的任务,我们现发布 JAXBench 基准测试、评估框架(harness)以及基线结果,以支持开源社区的贡献。 原文链接:https://arxiv.org/abs/2607.20466 前往小宇宙评论区与主播互动

About

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。