Seventy3

任雨山

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。

  1. 18h ago

    【第691期】MCP服务器架构模式

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: MCP Server Architecture Patterns for LLM-Integrated Applications Summary 模型上下文协议(Model Context Protocol,简称 MCP)由 Anthropic 于 2024 年 11 月推出,它定义了一个标准化接口,用于将大型语言模型(LLM)连接到外部工具、数据源和服务。在发布后的几个月内,GitHub 上就涌现出了数百个由社区构建的 MCP 服务器,但目前尚无软件维护方面的文献对该生态系统在生产环境中的构建方式进行过描述。本篇行业经验论文对通过枚举包含 15 个独立开发的服务器(包括来自 ANSYR 语音 AI 平台的 5 个生产服务器,以及来自官方 MCP 注册表的 10 个公共服务器)组成的语料库所观察到的五种循环出现的 MCP 服务器架构模式进行了分类编目:资源网关(Resource Gateway)、工具编排器(Tool Orchestrator)、有状态会话服务器(Stateful Session Server)、代理聚合器(Proxy Aggregator)和特定领域适配器(Domain-Specific Adapter)。每种模式都采用了 Gamma 等人(设计模式“四人帮”)的结构化形式进行描述:上下文、问题、解决方案以及后果。我们还记录了四种反模式(anti-patterns),以及围绕身份验证、版本控制和可观测性的一系列横切关注点(cross-cutting concerns)。定量评估贡献了三项测量结果:跨两个独立 LLM 评估员在 54 个留出(held-out)服务器上针对该分类法算出的评分者间一致性(Cohen's kappa = 0.76),这也定位出了三种模式边界的歧义性;在环回(loopback)路径上实测并针对跨主机路径建模的端到端传输开销;以及一项工具数量研究,结果显示对于 Claude Haiku 4.5,当每个上下文包含 10 到 15 个工具时,工具选择准确率会降至 90% 以下,而对于 Sonnet 4,该临界值在 20 到 30 个工具之间。代码、语料库和提示词已作为复现包发布。 原文链接:https://arxiv.org/abs/2606.30317 前往小宇宙评论区与主播互动

    【第691期】MCP服务器架构模式
  2. 1d ago

    【第690期】红皇后哥德尔机:共进化代理与评估器

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators Summary 自我提升 Agent(Self-improving agents)在 Agent 编程基准测试中达到了 SOTA(当前最佳水平),并且最近已被扩展到通用领域。然而,它们的搜索方法通常假设一个静态的评估标准:一个固定的验证器、基准测试或标注数据集,并且在 Agent 提升的过程中始终有效。这忽视了演化的一个核心特征:物种会随着环境的改变而发生适应性变化。我们的目标是将相同的原则引入递归自我提升中,将评估纳入提升循环,并向不断演化的评估器、对抗性目标和可能超越静态基准的动态效用函数(dynamic utilities)开放搜索。 我们提出了红皇后哥德尔机(Red Queen Gödel Machine, RQGM),这是一个在非静态效用函数下实现递归自我提升的演化框架。RQGM 通过受控的效用函数演化使这成为可能:搜索被划分为多个 epoch,每个 epoch 内部保持固定的评估标准,而在 epoch 的边界处可以更新效用函数;因此,随着目标跨 epoch 演化,每个 epoch 内部依然能够保持自我提升的保证。 我们首先表明,即使在可验证的编程任务上,RQGM 通过引入互补的“Agent 即裁判”(agent-as-a-judge)代码审查信号,相较于先前的 SOTA 提高了测试通过率。该信号的成本更低,且 RQGM 消耗的 Token 减少了 1.35 倍至 1.72 倍。随后,我们转向科学论文撰写与评审,以及奥林匹克级别的定理证明与批改任务,在这些领域中,RQGM 相比先前的自我提升 Agent 均取得了性能提升:共同演化(co-evolved)的论文撰写者在多元化的“Agent 即裁判”评审团下取得了 1.78 倍至 1.86 倍更高的接受率,而共同演化的批改者在真实标准(ground-truth)上的准确率提升了 9%。在论文评审中,最强的基线评审员对 AI 生成论文的过高接受率可达人类论文的 1.91 倍。RQGM 通过引入对抗性目标纠正了这一现象,从而发现了对 AI 和人类作品保持同等严苛程度的评审员。 原文链接:https://arxiv.org/abs/2606.26294 前往小宇宙评论区与主播互动

    【第690期】红皇后哥德尔机:共进化代理与评估器
  3. 3d ago

    【第688期】Skill-MAS:多智能体系统的元技能进化框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems Summary 基于大语言模型(LLM)的自动多智能体系统(MAS)生成已成为解决复杂任务的重要前沿方向。然而,现有的方法在“模型能力”与“经验保留”之间面临着两难困境:推理阶段 MAS 利用了冻结的顶尖 LLM,但因无法从过去经验中学习而导致重复相同的搜索;相反,训练阶段 MAS 通过梯度更新内化经验,却受限于较小模型较低的能力上限,且难以扩展至大型顶尖 LLM。为弥合这一差距,我们提出了 Skill-MAS,这是一种全新的“第三条路径”——它将高层级编排能力概念化为一种可进化的元技能(Meta-Skill),从而将经验保留与参数更新解耦。Skill-MAS 通过闭环优化机制来提炼该架构知识:(1) 多轨迹采样(Multi-Trajectory Rollout):在当前元技能下,针对每个任务采样行为分布;(2) 选择性反思(Selective Reflection):自适应选择高优先级任务,并运用分层对比分析将系统性经验提炼为通用的策略级原则。在 4 个复杂基准测试和 4 个不同 LLM 上的广泛实验表明,Skill-MAS 不仅取得了显著的性能提升,还保持了极佳的性价比。进一步的分析表明,进化出的元技能具有极高的鲁棒性,并在未见过的任务及不同的 LLM 之间展现出强大的可迁移性。 原文链接:https://arxiv.org/abs/2606.18837 前往小宇宙评论区与主播互动

    【第688期】Skill-MAS:多智能体系统的元技能进化框架
  4. 4d ago

    【第687期】自我对弈强化学习:30分钟数据教AI像人开车

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Human-like autonomy emerges from self-play and a pinch of human data Summary 自我对弈强化学习(Self-play reinforcement learning)近期成为一种无需任何人类数据即可训练驾驶策略的新方法。它利用低成本、大规模的仿真模拟来替代昂贵且大规模的人类驾驶演示。然而,该方法存在一个关键局限:通过纯自我对弈训练出的策略可能会学到有效但异类(alien)的驾驶习惯,与人类的习惯互不兼容。先前的研究尝试通过大量的奖励工程(reward engineering)和领域随机化(domain randomization)来缓解这种行为上的不对齐,但这些做法往往脆弱且耗费人力。 与完全抛弃人类演示不同,我们的方法将人类演示作为一种正则化目标,叠在极简的安全目标达成的奖励之上。正如好汤中的调味香料,我们发现少许人类数据就能起到极大的作用:我们的方法仅使用了 30 分钟的人类演示,比同类模仿学习方法减少了 2500 倍的数据量。由此产生的策略能够与未参与训练的人类轨迹达成协调,且在单块消费级 GPU 上仅需 15 小时即可完成训练。 原文链接:https://arxiv.org/abs/2606.19370 前往小宇宙评论区与主播互动

    【第687期】自我对弈强化学习:30分钟数据教AI像人开车
  5. 5d ago

    【第686期】大语言模型智能体通信协议技术分类

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: A Technical Taxonomy of LLM Agent Communication Protocols Summary 随着大语言模型(LLM)的发展,以及多智能体系统(multi-agent systems)致力于突破单体智能体的局限,稳健的通信协议正在成为分布式智能体网络不可或缺的基础设施。然而,碎片化的协议格局带来了显著的互操作性挑战。本研究建立了一个技术分类法(taxonomy),用以分类和分析 LLM 智能体通信协议。遵循成熟的迭代方法,我们定义了该分类法的目标、元特征及终止条件,随后对 9 个活跃维护且具备明确应用案例的开源协议开展了 5 轮迭代(3 轮由经验到概念,2 轮由概念到经验)。该分类法包含 5 个维度:对手方(counterparty)、有效载荷(payload)、交互状态(interaction state)、发现机制(discovery mechanism)以及架构模式/模式灵活性(schema flexibility)。分类结果揭示了屡次出现的架构模式:所有抽样的智能体对智能体(agent-to-agent)协议均结合了混合有效载荷与会话状态持久化;大多数协议支持多种预定义模式(schema),其中两个协议支持运行时模式协商,这表明协议正在走向模式灵活性;去中心化的发现机制依然罕见。分析表明,短期内存在将智能体对智能体通信与智能体对上下文(工具和数据)通信进行统一的协议收敛压力。然而从长期来看,没有任何单一协议能够同时实现通用性、效率和便携性的最大化。该领域更有可能演进为一个联邦化、分层的协议栈。该框架为协议选择提供了指导,并突出了隐私保护和策略执行等尚存的研究空白。 原文链接:https://arxiv.org/abs/2606.19135 前往小宇宙评论区与主播互动

    【第686期】大语言模型智能体通信协议技术分类
  6. 6d ago

    【第685期】Agent-as-a-Router:编程任务的智能模型路由框架

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Agent-as-a-Router: Agentic Model Routing for Coding Tasks Summary 在现实场景中,用户通常可以接入来自不同供应商的多个大语言模型(LLM),且这些 LLM 往往在不同的领域各有所长,但没有单个模型能够独霸所有领域。因此,将每个任务路由至最合适的模型,对于提升性能和控制成本均至关重要。 现有的路由器将该问题视为一种静态的、一次性的分类问题。然而,我们发现这些路由器的性能瓶颈在于信息匮乏:仅仅为原生 LLM 路由器补充任务维度层面的性能统计数据,就能带来 15.3% 的相对收益,超越基于同等维度先验构建的启发式路由方式。 受此发现启发,我们提出了 Agent-as-a-Router 框架,将路由过程形式化为一个 C-A-F 循环(上下文 Context →行动 Action → 反馈 Feedback → 上下文 Context)。该框架通过在部署期间不断积累基于执行实践的经验,填补了信息鸿沟。 我们将该框架实例化为 ACRouter(由协调器 Orchestrator、验证器 Verifier 和记忆模块 Memory 组成),并推出了 CodeRouterBench 评估环境——该环境包含约 1 万个任务实例,并附带来自 8 个前沿 LLM 的验证得分,从而支持在流式任务上进行基于“后悔值”(regret-based)的路由器对比。 实验表明,ACRouter 在域内(in-distribution)任务上取得了最低的累计后悔值,并且能够泛化至域外的具主体性编程(agentic-programming)任务,证明了我们的路由框架能够主动弥合信息差。 原文链接:https://arxiv.org/abs/2606.22902 前往小宇宙评论区与主播互动

  7. Aug 14

    【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据

    Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) 今天的这篇的主题是: Autodata: An agentic data scientist to create high quality synthetic data Summary 我们推出了 Autodata,这是一种能够让 AI 智能体充当“数据科学家”来构建高质量训练和评估数据的通用方法。我们展示了如何训练(元优化,meta-optimize)这样一个数据科学家智能体,使其学会创建质量更高的数据。 我们阐述了其整体公式设计,以及一个具体的实用实现方案——Agentic Self-Instruct。我们在计算机科学研究任务、法律推理任务以及数学对象推理任务上进行了实验,与传统合成数据集创建方法相比,我们取得了更优异的结果。此外,对数据科学家智能体本身进行元优化,带来了更为显著的性能提升。 具主体性的数据创建(Agentic data creation)提供了一种将增加的推理算力转化为更高质量模型训练的途径。总体而言,我们相信这一方向有望改变我们构建 AI 数据的方式。 原文链接:https://arxiv.org/abs/2606.25996 前往小宇宙评论区与主播互动

    【第684期】Autodata:以智能体模拟数据科学家构建高质量合成数据

About

73播客,名字取材于Sheldon最喜欢的数字,内容由NotebookLM生成,每天跟随AI读AI业界论文。