Seventy3

任雨山

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。

  1. 16h ago

    【第683期】Agent-Native Memory System的现状与评估综述

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Are We Ready For An Agent-Native Memory System? Summary 大语言模型(LLM)智能体的记忆系统已迅速从简单的检索增强机制,演变为能够在智能体执行过程中支持持久化信息存储、检索、更新、整合以及动态生命周期管理的数据管理系统。尽管有了这样的演进,现有评估仍主要通过端到端任务成功率指标(例如 F1、BLEU)来对智能体记忆进行基准测试,同时将底层系统视为一个单体黑盒。因此,包括运营成本、跨记忆模块的架构权衡以及在动态知识更新下的鲁棒性等关键系统层面的关切,依然缺乏充分探讨。 在本文中,我们从数据管理的视角对智能体记忆进行了系统的实验研究。我们提出了一个分析框架,将智能体记忆拆解为四个核心模块: 记忆表示与存储(memory representation and storage) 抽取(extraction) 检索与路由(retrieval and routing) 维护(maintenance) 在该框架下,我们在涵盖 11 个数据集的 5 个基准工作负载上,评估了 12 个具有代表性的记忆系统和 2 个参考基准(baselines)。 我们广泛的端到端评估表明,没有任何单一架构能在所有场景中占据绝对主导地位;相反,其有效性在很大程度上取决于记忆结构与工作负载瓶颈的匹配程度。此外,通过细粒度的消融实验,我们量化了各模块对表示忠实度、检索精确度、更新正确性以及长程稳定性的具体影响。 最后,我们揭示了在现实工作负载下的成本与性能权衡,表明局部维护比全局重组具有更高的成本效益。基于这些发现,我们指出了构建真正“智能体原生”(agent-native)记忆系统的前景方向。 原文链接:https://arxiv.org/abs/2606.24775 前往小宇宙评论区与主播互动

    【第683期】Agent-Native Memory System的现状与评估综述
  2. 1d ago

    【第682期】Sakana Fugu 技术报告:通过集体智能实现模型编排

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Sakana Fugu Technical Report Summary 前沿大语言模型(LLM)的能力持续提升,不同的提供商也日益在各自的领域形成独特优势。这自然引出了下一个目标:如何将各个 LLM 的独特专长整合为一个协同智能系统。为此,我们报告了 Sakana Fugu 的研发进展——这是一个协调器(orchestrator)模型家族,旨在驾驭并放大 LLM 智能体团队的能力。 Fugu 模型本身也是语言模型,经过专门训练后,能够理解用户查询并动态设计“具主体性”(agentic)的支架来解决问题。通过这些自适应支架,Fugu 释放出了超越任何单一 LLM 智能体的高强性能,在一系列极具挑战性的任务中(包括 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 以及 CharXiv Reasoning),相较于其他公开可用的模型取得了最前沿(SOTA)的成果。 我们发布了两款模型: Fugu:兼顾性能与延迟,适合日常使用; Fugu-Ultra:在极高难度的任务上优先保证回答质量。 我们详细阐述了自身的训练范式——涵盖大规模微调、进化算法与强化学习方法,以及将这些方法转化为生产级系统的基础设施和核心设计原则。我们希望本报告能够推动对多智能体系统以及“动态/查询自适应”智能体支架的进一步研究,将其作为通过群体智能迈向 AI 能力下一前沿的有效路径。 原文链接:https://arxiv.org/abs/2606.21228 前往小宇宙评论区与主播互动

  3. 2d ago

    【第681期】Critique of Agent Model:从代理系统到自主主体的演进

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Critique of Agent Model Summary 什么是智能体(Agent)?什么构成了主体性(Agency)?随着被营销为“编程智能体”、“AI联合科学家”以及其他承诺能大幅提升生产力的“具主体性”(agentic)工具的崛起,与此同时,关于AI可能在推测性的“机器主体性”驱使下摆脱人类控制并施加破坏性力量等“生存级”担忧也日益增长。在此背景下,无论对于构建能力强大的系统,还是对于理解我们是否以及该恐惧什么,明确自动化在哪里终结、主体性从哪里开始,都已变得至关重要。 借鉴笛卡尔将主体性建立在独立思考之上的观点,以及科幻小说中对自主存在的描绘,我们综述了当前AI智能体的现状,并从五个维度分析了智能体架构:目标(goal)、身份(identity)、决策(decision-making)、自我调节(self-regulation)和学习(learning)。 具体而言,我们认为真正的主体性要求这些结构内化于系统本身内部,而非通过外部支架搭建而成。这种在“代理型”(agentic)系统(其能力依赖于工程化的工作流)与“主体型”(agentive)系统(其能力包括社交互动,均源于内生)之间的区分,划清了专为预设任务设计的系统与能够在开放世界中以真正自主性运行的系统之间的界限。 基于这一分析,我们提出了一种用于通用智能体模型的“目标-身份-配置器”(Goal-Identity-Configurator, GIC)架构,它结合了层级化目标分解、身份演化、基于独立训练的世界模型的模拟推理、习得性自我调节,以及来自真实与模拟经验的自主学习。 此外,我们还就拥有更高自主性和“主体性”但仍处于人类监督之下的主体型系统的可审计性、可控性和安全性分享了见解。 原文链接:https://arxiv.org/abs/2606.23991 前往小宇宙评论区与主播互动

    【第681期】Critique of Agent Model:从代理系统到自主主体的演进
  4. 3d ago

    【第680期】世界价值模型:机器人操纵的通用价值评估

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: World Value Models for Robotic Manipulation Summary 通用价值模型(Generalist value models)在从大规模、质量混合的数据中扩展机器人策略学习方面发挥着关键作用。从数学角度来看,准确的价值估计需要深刻的时序理解,这要求模型既能利用历史上下文来锚定当前信念,又能对未来结果进行规划。 然而,大多数现有的机器人价值模型都是基于视觉语言模型(VLM)底座构建的,这些底座主要在静态或时序稀疏的视觉观测数据上进行预训练,缺乏价值估计所需的时序建模能力。与 VLM 不同,世界模型(world models)天然擅长时序建模与未来规划,这使其成为学习具备泛化能力的价值函数的理想基础。 基于这一洞察,我们将世界模型与价值估计相结合,构建了一种全新的机器人通用价值模型——世界价值模型(World Value Model,简称 WVM),能够提供准确的任务进度预测以评估数据质量。 在标准基准测试中,WVM 取得了最先进的(SOTA)价值顺序相关性(VOC)结果。除了仅包含专家数据的标准评估套件外,我们还推出了 Suboptimal-Value-Bench,这是一个多具身(multi-embodiment)基准测试,由 800 条包含高保真、人工标注帧标签的次优轨迹组成。评估表明,WVM 在 Suboptimal-Value-Bench 上依然保持了 SOTA 性能,证实了其在处理专家数据和次优数据时的鲁棒性。 当应用于策略学习时,无论在模拟环境还是真实世界的部署中,WVM 都提升了各种策略提取方法的操纵性能,为从混合质量的数据中进行学习提供了稳健的指导。 原文链接:https://arxiv.org/abs/2606.24742 前往小宇宙评论区与主播互动

  5. 4d ago

    【第679期】PAPO:对齐扩散大语言模型推理的奖励与状态

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language ModelsSummary 强化学习(RL)在提升扩散大语言模型(dLLM)的推理能力方面蕴含着巨大的潜力。然而,这一领域的进展从根本上受到了真实生成轨迹与梯度更新过程之间“双重错位”(dual misalignment)的限制: 过程-奖励错位(Process-reward misalignment):稀疏的终局奖励被无差别地赋予给生成过程的所有中间步骤,无法提供区分度高的信用分配(credit assignment)。 状态-轨迹错位(State-trajectory misalignment):策略更新往往偏离至人造的、脱离轨迹的状态,将梯度浪费在信息量较低的样本上。 为了解决这些局限,我们提出了过程对齐策略优化(Process Aligned Policy Optimization,简称 PAPO)。这是一个全新的框架,通过两大机制将 RL 更新与 dLLM 的生成轨迹进行整体对齐: 步骤感知过程奖励(Step-Aware Process Rewards,简称 SPR):将稀疏的终局奖励转化为密集的步骤级信用; 熵引导历史重演(Entropy-Guided Historical Re-enactment,简称 EHR):在高不确定性步骤下重演真实轨迹。 在四个基准测试上的大量实验表明,PAPO 显著优于基线方法,在 GSM8K 上实现了高达 4.5% 的提升, MATH500 上提升 4.8%, Countdown 上提升 42.2%, 数独(Sudoku)上提升 16.1%。 原文链接:https://arxiv.org/abs/2606.08501 前往小宇宙评论区与主播互动

  6. 5d ago

    【第678期】OpenClaw-Skill:基于集合技能树搜索的智能体强化学习

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models Summary 为大语言模型(LLM)Agent 赋予有效的技能,对于解决像 OpenClaw 这类现实世界系统中的复杂任务至关重要。在这项工作中,我们的目标是开发一个能够自动构建此类可重用技能的框架,从而增强 LLM 在工具使用、多步推理以及动态环境交互方面的能力。 为此,我们提出了群体技能树搜索(Collective Skill Tree Search,简称 CSTS),这是一种全新的基于树搜索的技能构建框架,能够构建出结构化、多样化且具备泛化能力的技能树。CSTS 的核心思想是利用群体智慧,通过两个迭代阶段来共同搜索、识别与组合有效技能:群体技能节点生成(CSN-Gen)和群体技能节点评估(CSN-Assess)。CSN-Gen 利用来自多个模型的群体知识,为每个子任务探索多样化的候选技能,从而实现全面的技能探索。CSN-Assess 则采用多个模型作为裁判,通过两种打分机制来评估和选择技能节点:(1)群体质量打分,通过聚合独立评估,对技能有效性做出稳健的估计;(2)群体可迁移性打分,显式地验证某项技能是否能在不同模型间良好泛化。 借由 CSTS,我们构建了一套完整的技能树以及技能增强的训练数据,使模型能够有效地学习并利用技能。此外,我们还引入了群体技能强化学习,它能主动从树中选择多个相关技能,以拓宽解空间探索,避免陷于单一技能及其产生的同质化或次优解中。 结果表明,我们训练出的模型 OpenClaw-Skill 在长流程规划、工具使用以及挑战性基准测试的泛化能力方面,展现出了卓越的 Agent 能力。 原文链接:https://arxiv.org/abs/2606.16774 前往小宇宙评论区与主播互动

  7. 6d ago

    【第677期】从学徒到导师:强化学习环境生成框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent ReasoningSummary 强化学习(RL)在大语言模型(LLM)训练中的流水线,通常依赖于在不同阶段之间手动重新设计环境,这就需要从业人员凭启发式经验去推断哪种配置最能提升当前的策略模型。 为了将这一过程实现自动化,我们提出了 LLM 作为环境工程师(LLM-as-Environment-Engineer)的框架:在该框架中,当前的策略模型会分析失败轨迹并结合上下文信息,从而为下一阶段的训练环境配置提出修改建议。 我们还推出了 MAPF-FrozenLake,这是一个可控的测试床,其生成器暴露了多维度的环境配置,非常适合用来研究和评估环境的重新设计。在该测试床中,我们以策略行为、失败案例和环境统计数据的结构化摘要作为条件引导环境工程师,使其生成下一训练阶段的配置。 在以 Qwen3-4B 作为骨干模型时,我们的框架在基准测试中取得了最强的综合性能,超越了更大的闭源商业 LLM(例如 GPT、Gemini)以及固定环境训练的基线方法。 我们进一步分析了哪种形式的上下文最为有效,发现成功的环境更新依赖于失败证据,并且会保留已经生效的配置。有趣的是,当前的 RL 检查点(checkpoint)比原始的基座模型能扮演更好的环境工程师角色,这表明策略学习提升了模型诊断自身剩余缺陷的能力。 原文链接:https://arxiv.org/abs/2606.17682 前往小宇宙评论区与主播互动

  8. Aug 6

    【第676期】智能自动机学习:大语言模型智能体发现世界模型

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning Summary 我们提出了“Agent 化的自动机学习”(agentic automata learning),用于评估工具调用型 LLM Agent 通过交互揭示隐藏环境的能力。 在我们的设定中,Agent 需通过与 Oracle(神谕/专家)进行两种交互来揭示一个隐藏的确定性有限状态自动机(DFA):(1)成员查询(“该字符串是否属于目标语言?”)以及(2)等价性查询(“这是目标 DFA 吗?”)。这提供了一个具有可控任务复杂度、可测量交互效率以及强基线(传统的自动机学习算法)的可扩展测试床。 对最先进的 LLM 进行评估后,我们发现其性能随着 DFA 规模的增大而急剧下降。推理模型(reasoning models)的表现显著强于非推理模型,但轨迹分析揭示了其在查询规划、证据整合和假设构建方面反复出现的失败。 总体而言,我们的结果表明,当前的 LLM Agent 有时能够完成非平凡的交互式探索,但该任务上的鲁棒性和效率仍远落后于传统算法。 原文链接:https://arxiv.org/abs/2606.16576 前往小宇宙评论区与主播互动

About

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。