Seventy3

任雨山

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。

  1. 1 రోజు క్రితం

    【第688期】Skill-MAS:多智能体系统的元技能进化框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems Summary 基于大语言模型(LLM)的自动多智能体系统(MAS)生成已成为解决复杂任务的重要前沿方向。然而,现有的方法在“模型能力”与“经验保留”之间面临着两难困境:推理阶段 MAS 利用了冻结的顶尖 LLM,但因无法从过去经验中学习而导致重复相同的搜索;相反,训练阶段 MAS 通过梯度更新内化经验,却受限于较小模型较低的能力上限,且难以扩展至大型顶尖 LLM。为弥合这一差距,我们提出了 Skill-MAS,这是一种全新的“第三条路径”——它将高层级编排能力概念化为一种可进化的元技能(Meta-Skill),从而将经验保留与参数更新解耦。Skill-MAS 通过闭环优化机制来提炼该架构知识:(1) 多轨迹采样(Multi-Trajectory Rollout):在当前元技能下,针对每个任务采样行为分布;(2) 选择性反思(Selective Reflection):自适应选择高优先级任务,并运用分层对比分析将系统性经验提炼为通用的策略级原则。在 4 个复杂基准测试和 4 个不同 LLM 上的广泛实验表明,Skill-MAS 不仅取得了显著的性能提升,还保持了极佳的性价比。进一步的分析表明,进化出的元技能具有极高的鲁棒性,并在未见过的任务及不同的 LLM 之间展现出强大的可迁移性。 原文链接:https://arxiv.org/abs/2606.18837 前往小宇宙评论区与主播互动

    【第688期】Skill-MAS:多智能体系统的元技能进化框架
  2. 2 రోజుల క్రితం

    【第687期】自我对弈强化学习:30分钟数据教AI像人开车

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Human-like autonomy emerges from self-play and a pinch of human data Summary 自我对弈强化学习(Self-play reinforcement learning)近期成为一种无需任何人类数据即可训练驾驶策略的新方法。它利用低成本、大规模的仿真模拟来替代昂贵且大规模的人类驾驶演示。然而,该方法存在一个关键局限:通过纯自我对弈训练出的策略可能会学到有效但异类(alien)的驾驶习惯,与人类的习惯互不兼容。先前的研究尝试通过大量的奖励工程(reward engineering)和领域随机化(domain randomization)来缓解这种行为上的不对齐,但这些做法往往脆弱且耗费人力。 与完全抛弃人类演示不同,我们的方法将人类演示作为一种正则化目标,叠在极简的安全目标达成的奖励之上。正如好汤中的调味香料,我们发现少许人类数据就能起到极大的作用:我们的方法仅使用了 30 分钟的人类演示,比同类模仿学习方法减少了 2500 倍的数据量。由此产生的策略能够与未参与训练的人类轨迹达成协调,且在单块消费级 GPU 上仅需 15 小时即可完成训练。 原文链接:https://arxiv.org/abs/2606.19370 前往小宇宙评论区与主播互动

    【第687期】自我对弈强化学习:30分钟数据教AI像人开车
  3. 3 రోజుల క్రితం

    【第686期】大语言模型智能体通信协议技术分类

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: A Technical Taxonomy of LLM Agent Communication Protocols Summary 随着大语言模型(LLM)的发展,以及多智能体系统(multi-agent systems)致力于突破单体智能体的局限,稳健的通信协议正在成为分布式智能体网络不可或缺的基础设施。然而,碎片化的协议格局带来了显著的互操作性挑战。本研究建立了一个技术分类法(taxonomy),用以分类和分析 LLM 智能体通信协议。遵循成熟的迭代方法,我们定义了该分类法的目标、元特征及终止条件,随后对 9 个活跃维护且具备明确应用案例的开源协议开展了 5 轮迭代(3 轮由经验到概念,2 轮由概念到经验)。该分类法包含 5 个维度:对手方(counterparty)、有效载荷(payload)、交互状态(interaction state)、发现机制(discovery mechanism)以及架构模式/模式灵活性(schema flexibility)。分类结果揭示了屡次出现的架构模式:所有抽样的智能体对智能体(agent-to-agent)协议均结合了混合有效载荷与会话状态持久化;大多数协议支持多种预定义模式(schema),其中两个协议支持运行时模式协商,这表明协议正在走向模式灵活性;去中心化的发现机制依然罕见。分析表明,短期内存在将智能体对智能体通信与智能体对上下文(工具和数据)通信进行统一的协议收敛压力。然而从长期来看,没有任何单一协议能够同时实现通用性、效率和便携性的最大化。该领域更有可能演进为一个联邦化、分层的协议栈。该框架为协议选择提供了指导,并突出了隐私保护和策略执行等尚存的研究空白。 原文链接:https://arxiv.org/abs/2606.19135 前往小宇宙评论区与主播互动

    【第686期】大语言模型智能体通信协议技术分类
  4. 4 రోజుల క్రితం

    【第685期】Agent-as-a-Router:编程任务的智能模型路由框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agent-as-a-Router: Agentic Model Routing for Coding Tasks Summary 在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。 现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。 受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。 我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。 实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。 原文链接:https://arxiv.org/abs/2606.22902 前往小宇宙评论区与主播互动

  5. 5 రోజుల క్రితం

    【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Autodata: An agentic data scientist to create high quality synthetic data Summary 我们推出了 Autodata,这是一种能够让 AI 智能体充当“数据科学家”来构建高质量训练和评估数据的通用方法。我们展示了如何训练(元优化,meta-optimize)这样一个数据科学家智能体,使其学会创建质量更高的数据。 我们阐述了其整体公式设计,以及一个具体的实用实现方案——Agentic Self-Instruct。我们在计算机科学研究任务、法律推理任务以及数学对象推理任务上进行了实验,与传统合成数据集创建方法相比,我们取得了更优异的结果。此外,对数据科学家智能体本身进行元优化,带来了更为显著的性能提升。 具主体性的数据创建(Agentic data creation)提供了一种将增加的推理算力转化为更高质量模型训练的途径。总体而言,我们相信这一方向有望改变我们构建 AI 数据的方式。 原文链接:https://arxiv.org/abs/2606.25996 前往小宇宙评论区与主播互动

    【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据
  6. 6 రోజుల క్రితం

    【第683期】Agent-Native Memory System的现状与评估综述

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Are We Ready For An Agent-Native Memory System? Summary 大语言模型(LLM)智能体的记忆系统已迅速从简单的检索增强机制,演变为能够在智能体执行过程中支持持久化信息存储、检索、更新、整合以及动态生命周期管理的数据管理系统。尽管有了这样的演进,现有评估仍主要通过端到端任务成功率指标(例如 F1、BLEU)来对智能体记忆进行基准测试,同时将底层系统视为一个单体黑盒。因此,包括运营成本、跨记忆模块的架构权衡以及在动态知识更新下的鲁棒性等关键系统层面的关切,依然缺乏充分探讨。 在本文中,我们从数据管理的视角对智能体记忆进行了系统的实验研究。我们提出了一个分析框架,将智能体记忆拆解为四个核心模块: 记忆表示与存储(memory representation and storage) 抽取(extraction) 检索与路由(retrieval and routing) 维护(maintenance) 在该框架下,我们在涵盖 11 个数据集的 5 个基准工作负载上,评估了 12 个具有代表性的记忆系统和 2 个参考基准(baselines)。 我们广泛的端到端评估表明,没有任何单一架构能在所有场景中占据绝对主导地位;相反,其有效性在很大程度上取决于记忆结构与工作负载瓶颈的匹配程度。此外,通过细粒度的消融实验,我们量化了各模块对表示忠实度、检索精确度、更新正确性以及长程稳定性的具体影响。 最后,我们揭示了在现实工作负载下的成本与性能权衡,表明局部维护比全局重组具有更高的成本效益。基于这些发现,我们指出了构建真正“智能体原生”(agent-native)记忆系统的前景方向。 原文链接:https://arxiv.org/abs/2606.24775 前往小宇宙评论区与主播互动

    【第683期】Agent-Native Memory System的现状与评估综述
  7. 12 ఆగ

    【第682期】Sakana Fugu 技术报告:通过集体智能实现模型编排

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Sakana Fugu Technical Report Summary 前沿大语言模型(LLM)的能力持续提升,不同的提供商也日益在各自的领域形成独特优势。这自然引出了下一个目标:如何将各个 LLM 的独特专长整合为一个协同智能系统。为此,我们报告了 Sakana Fugu 的研发进展——这是一个协调器(orchestrator)模型家族,旨在驾驭并放大 LLM 智能体团队的能力。 Fugu 模型本身也是语言模型,经过专门训练后,能够理解用户查询并动态设计“具主体性”(agentic)的支架来解决问题。通过这些自适应支架,Fugu 释放出了超越任何单一 LLM 智能体的高强性能,在一系列极具挑战性的任务中(包括 SWE-Bench Pro、Terminal Bench、LiveCodeBench、GPQA-Diamond、Humanity's Last Exam 以及 CharXiv Reasoning),相较于其他公开可用的模型取得了最前沿(SOTA)的成果。 我们发布了两款模型: Fugu:兼顾性能与延迟,适合日常使用; Fugu-Ultra:在极高难度的任务上优先保证回答质量。 我们详细阐述了自身的训练范式——涵盖大规模微调、进化算法与强化学习方法,以及将这些方法转化为生产级系统的基础设施和核心设计原则。我们希望本报告能够推动对多智能体系统以及“动态/查询自适应”智能体支架的进一步研究,将其作为通过群体智能迈向 AI 能力下一前沿的有效路径。 原文链接:https://arxiv.org/abs/2606.21228 前往小宇宙评论区与主播互动

పరిచయం

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。