Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

  1. -13 h

    【第708期】大语言模型元认知:基础、进展与机遇

    今天的这篇的主题是:Metacognition in LLMs: Foundations, Progress, and OpportunitiesSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 元认知(Metacognition)是智能的奠基性组成部分,对有效学习、问题解决、决策制定、沟通交流等能力至关重要。近年来,它已日益被公认为构建具备高能力与透明度的 AI 系统的基石。然而,尽管大语言模型(LLM)在各类现实任务中取得了显著进展,但它们在何时、以何种方式、以及在多大程度上能够展现或被赋予有效的元认知能力,以及这些能力如何被适用来推进 AI 系统的基础能力、可靠性和智能水平,目前尚不明确。 本文通过首次全面综述 LLM 元认知领域的现状,填补了这一空白。我们对这一新兴领域的全景进行了分析与分类,并总结了最新的技术进展,包括:测量与评估 LLM 元认知能力的方法和基准、在 LLM 中诱导、提升和应用元认知的技术,以及持续研究中的发现与启示。我们还讨论了应用场景、开放性问题与挑战,以及未来极具前景的研究方向。我们的目标是为该主题提供详细且前沿的综述,并激发有意义的研究与讨论。 原文链接:https://arxiv.org/abs/2607.11881 前往小宇宙评论区与主播互动

  2. -1 j

    【第707期】自进化AI智能体综述:从模型优化到框架增强

    今天的这篇的主题是:Self-Improvements in Modern Agentic Systems: A SurveySeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 自我改进型自主 Agent(Self-improving autonomous agents)正在从研究原型走向部署系统。其核心目标是实现可控演进(controllable evolution)或自适应——即在极少甚至完全没有人类介入的情况下,从经验中不断进化。 本综述将现代自我改进型 Agent 构想为一种自适应系统,该系统能够将经验转化为累积的能力提升。我们提出了一个系统级框架,将现代 Agent 表征为一种配置(configuration):该配置将基础模型与由 Prompt、记忆、工具和控制逻辑构成的运行支架(operational scaffold)相耦合。 在该框架下,自我改进被形式化定义为一个自感应更新算子(self-induced update operator),该算子负责获取并向模型参数或支架组件提交更新。我们按照更新目标与驱动变更的信号对现有工作进行了梳理归类,随后综述了相关应用并讨论了评估方法,最后以开放性问题与未来方向进行了总结。 原文链接:https://arxiv.org/abs/2607.13104 前往小宇宙评论区与主播互动

    【第707期】自进化AI智能体综述:从模型优化到框架增强
  3. -2 j

    【第706期】Paper-replication:科学机器学习的编码代理工作流

    今天的这篇的主题是:Coding-agents can replicate scientific machine learning papersSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 科学机器学习(Scientific machine learning)论文通常会提出具体的计算主张,例如:相对均方误差小于 5%,或 95% 的预测置信区间覆盖了测试数据。即便仅依靠论文材料,也可以提示编码 Agent 去复现这些主张;然而,提示词本身并不能可靠地记录复现进度,也无法检验生成的证据是否真正支持论文的主张。 为此,我们引入了 Paper-replication:一种将选定的论文主张转化为带有记录证据的“目标”(target)的工作流,并将其实现为一种编码 Agent 技能(coding-agent skill)。该工作流使 Agent 能够记录这些目标、重构论文的方法、运行计算实验、将生成的输出与出处以及论文的主张对比进行关联、记录匹配证据在复现报告中的具体出处,并在完成前通过校验检查。 我们在四篇科学机器学习论文上进行了 12 次独立运行,以此对 Paper-replication 进行了评估。所有 12 个工作区均通过了完成门槛(completion gate),且所有 158 个记录的目标均在报告中得到了匹配覆盖。即便在这些已完成的工作区状态下,多次重复运行在以下方面仍存在差异:论文被拆分为目标的方式、与源论文的数值忠实度、复现耗时、在最终证据被接受前所替换的中间执行次数,以及用于接受证据的规则。Paper-replication 使任务的最终完成依赖于工作区内的证据和校验检查,而非 Agent 本身发送的最终消息。 原文链接:https://arxiv.org/abs/2607.02134 前往小宇宙评论区与主播互动

  4. -3 j

    【第705期】eContext:让AI学会划重点读长文档

    今天的这篇的主题是:ReContext: Recursive Evidence Replay as LLM Harness for Long-Context ReasoningSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 长上下文的理解与推理已成为在实际应用中部署大语言模型(LLM)的核心需求。尽管近期的 LLM 支持越来越长的上下文窗口,但它们往往无法有效利用输入中已存在的关键证据,这揭示了“上下文接入”与“上下文有效利用”之间存在差距。 在本研究中,我们提出了 RECONTEXT(Recursive Evidence Replay as LLM Harness for Long-Context Reasoning,基于递归证据重放的长上下文推理 LLM 框架),这是一种用于提升长上下文推理能力的无须训练的推理阶段方法(training-free inference method)。RECONTEXT 利用模型内部的相关性信号构建一个以查询为条件的证据池,并在最终生成前对其进行重放,同时完整保留原始上下文。这一递归选择过程在不进行训练、不使用外部记忆库也不剪枝上下文的前提下,实现了证据组织与答案生成的剥离。 此外,我们还基于联想记忆(associative memory)提供了理论分析:将上下文表征为记忆存储,将问题表征为检索线索,将注意力表征为线索-痕迹联结(cue-trace association),并将重放表征为痕迹再激活(trace reactivation)。在上下文长度为 128K 的 8 个长上下文数据集上的实验表明,RECONTEXT 在 Qwen3-4B、Qwen3-8B 和 Llama3-8B 模型上一致提升了证据利用率,并在所有三个基座模型上均取得了最佳平均排名。 原文链接:https://arxiv.org/abs/2607.02509 前往小宇宙评论区与主播互动

    【第705期】eContext:让AI学会划重点读长文档
  5. -4 j

    【第704期】The Harness Effect:生成式 AI 编排层的令牌经济学

    今天的这篇的主题是:The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AISeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 当今 Agentic AI(智能体 AI)的开发建立在“Token 极值化”(token maxing)之上:即通过消耗 Token 来换取能力——更长推理链(reasoning traces)、更多轮次、更宽泛的工具载荷(tool payloads)、更庞大的重放上下文(replayed contexts)——导致每个任务消耗的 Token 数增长速度超过了任务本身的价值。单 Token 价格的下降掩盖了这一模式;总支出依然在上升。 我们认为,应对 Token 极值化的关键杠杆是 Harness(调度/治理框架):即负责组装上下文、暴露工具、排列轮次顺序、委派工作并承载企业级可观测性与治理的编排层(orchestration layer)。我们通过一项控制变量实验将其独立评估:在 22 个锁定的评估任务、6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)下,仅改变编排层——对比冻结的传统生产循环与 Writer Agent Harness。 在保持模型不变的情况下,该 Harness 使单任务混合成本降低了 41%($0.21 -> $0.12),中位数耗时(wall-clock)缩短了 44%(48s -> 27s),单任务 Token 消耗减少了 38%(14.2k -> 8.8k),同时任务完成质量保持相当(0.78 -> 0.81,在该样本量下具方向性指示意义)。效率提升具有模型无关性(model-invariant)——每个模型的成本均有所降低(33%–61%);而质量提升则依赖于模型本身的能力:模型的质量增益与其基线能力呈近乎完美的正相关(r=0.99, n=6),我们将这一现象称为 Harness 杠杆效应(harness leverage)。每美元质量比提升了 82%;每百万 Token 完成的任务数从 54.9 增至 92.0。 在该工作负载下,编排层对单任务成本的影响甚至超过了整个模型菜单的全部价差。我们在编排层对 Token 经济学进行了形式化(包括 Prompt 缓存下的有效输入价格),详细阐述了该效应背后的六大机制家族(从缓存形态规范到失效支出治理),在相同维度上对比了六种广泛使用的 Agent 系统,并论证了 Harness 是唯一能够将其效率成倍叠加到企业运行的每一个模型(无论是现有还是未来模型)之上的组件。 原文链接:https://arxiv.org/abs/2607.06906 前往小宇宙评论区与主播互动

  6. -5 j

    【第703期】常驻 Agent(Always-on agents):大模型持久化状态、记忆与治理综述

    今天的这篇的主题是:Always-On Agents: A Survey of Persistent Memory, State, and Governance in LLM AgentsSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 常驻 Agent(Always-on agents)是指其未来行为依赖于在早期交互中累积的持久状态的系统。我们将它们视为持久状态系统:该生效系统不仅包括可检索的内存,还包括任务账本、权限、凭证、承诺、出处与审计记录、共享状态、触发条件以及与这些记录相关的外部已生效影响。本综述通过每个状态项的六个诊断轴(权威性、作用域、可变性、出处、可恢复性和可行动性),以及状态经历写入、验证、组织、检索、行动、更新、遗忘、审计和有时回滚的生命周期,对相关文献进行了解读。在对 435 篇文献进行编码的语料库(将其视为范围明确的映射而非全面普查)中,现有文献更侧重于状态的累积和检索,而非状态的治理、恢复或放弃。因此,我们提出了常驻评估协议(Always-On Evaluation Protocol, AOEP-v0),这是一个试点评估契约,通过对状态变更和恢复义务进行评分(而非仅对回答质量评分),使这些治理要求具体化。由此产生的议题将常驻 Agent 与数据库、分布式系统、形式化方法、能力安全性以及机器遗忘连接起来。 原文链接:https://arxiv.org/abs/2606.30306 前往小宇宙评论区与主播互动

  7. -6 j

    【第702期】LLM-as-a-Verifier:通用验证框架与缩放范式

    今天的这篇的主题是:LLM-as-a-Verifier: A General-Purpose Verification FrameworkSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 扩展预训练(Pre-training)、后训练(Post-training)以及测试时计算量(Test-time Compute)已成为提升大型语言模型(LLM)能力的核心范式。在这项工作中,我们将“验证能力”(即确定解决方案正确性的能力)识别为一种全新的扩展轴(Scaling Axis)。为了解锁这一维度并证明其有效性,我们提出了“LLM-as-a-Verifier”——这是一个通用的验证框架,无需额外训练即可为智能体任务(Agentic Tasks)提供细粒度的反馈。与提示 LLM 为候选方案输出离散评分的标准 LM 评测器(LM Judges)不同,LLM-as-a-Verifier 通过计算评分 Token Logit 分布的期望值来生成连续分数。这种概率化的表征方式使得验证能够沿着多个维度进行扩展:(1)评分粒度、(2)重复评估,以及(3)标准分解。特别是,我们表明扩展评分粒度可以更好地区分正确与错误方案,从而实现更加校准的对比。此外,通过降低方差和复杂度,扩展重复评估与标准分解能稳步地进一步提升验证准确率。我们还提出了一种低成本的高效排序算法,利用验证器的连续分数从候选方案中挑选出最佳结果。LLM-as-a-Verifier 在 Terminal-Bench V2 (86.5%)、SWE-Bench Verified (78.2%)、RoboRewardBench (87.4%) 和 MedAgentBench (73.3%) 上均取得了业界领先(SOTA)的性能。除了验证本身之外,来自 LLM-as-a-Verifier 的细粒度信号还可以作为估计任务进度的代理指标。我们针对 Claude Code 构建了一个扩展程序,使开发者能够监控并改进他们自己的智能体系统。最后,我们展示了 LLM-as-a-Verifier 能够为强化学习(RL)提供密集反馈,从而在机器人学和数学推理基准测试中提升 SAC 和 GRPO 的采样效率。 原文链接:https://arxiv.org/abs/2607.05391 前往小宇宙评论区与主播互动

    【第702期】LLM-as-a-Verifier:通用验证框架与缩放范式
  8. 31 août

    【第701期】AgentDNS:大语言模型智能体根域名系统

    今天的这篇的主题是:AgentDNS: A Root Domain Naming System for LLM AgentsSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 大型语言模型(LLM)智能体的快速发展凸显了跨厂商服务发现、互操作性与通信方面的重大挑战。现有协议(如模型上下文协议和智能体间通信协议)在标准化智能体与工具之间的互操作性以及多智能体间的通信方面取得了显著进展。然而,目前仍缺乏针对不同智能体和工具厂商之间服务发现的标准化协议与解决方案。在本文中,我们提出了 AgentDNS,这是一个根域名命名与服务发现系统,旨在使 LLM 智能体能够自主地跨越组织和技术边界,对第三方智能体及工具服务进行发现、解析和安全调用。受传统 DNS 原理的启发,AgentDNS 引入了包含服务注册、语义服务发现、安全调用和统一计费的结构化机制。我们详细阐述了 AgentDNS 的架构、核心功能与应用场景,展示了其在真实场景中简化多智能体协作的巨大潜力。 原文链接:https://arxiv.org/abs/2505.22368 前往小宇宙评论区与主播互动

    【第701期】AgentDNS:大语言模型智能体根域名系统

À propos

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

Vous aimeriez peut‑être aussi