Seventy3

任雨山

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

  1. 22小時前

    【第719期】GAMUT:大语言模型长文本生成事实完备性评价基准

    今天的这篇的主题是: Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 基于标准(Rubric-based)的开放式生成评估面临着表达力与可靠性之间的根本矛盾。撰写一份忠实准确的评估标准,需要表达出优秀回答空间所具备的结构特征:包含可接受选项的开放式集合、有序的流程以及事实的相对重要性。而使用该标准进行打分,则要求评估器(judge)保持一致性,评估器在处理扁平化的二元检查时,其可靠性远高于处理丰富的结构化内容。 我们通过一个两层元标准(meta-rubric)框架解决了这一矛盾。在撰写阶段,结构化元标准用于捕捉评分标准;随后,固定且机械化的规则会将其编译为由“二元、可由机器打分”的检查项目构成的扁平清单,LLM 评估器即可在评估阶段对其进行可靠的评分。 我们将该框架实例化为 Gamut(长文本事实性接地评估,Grounded Assessment of Multimodal Factuality),这是一个用于评估长文本生成中事实完整性的基准测试。Gamut 包含 1,813 个基于真实穿戴设备图像的问题,涵盖 10 个不同的领域,每个问题均配有由专家人类标注者验证且有证据支持的评估标准。在对 14 个前沿模型及开源模型进行评估后,我们发现 Gamut 极具挑战性(Gemini 3.1 Pro 取得了最高分 58.7%)、具备高度的区分度,且对评估器的选择具有很强的鲁棒性。 原文链接:https://arxiv.org/abs/2607.19322 前往小宇宙评论区与主播互动

    【第719期】GAMUT:大语言模型长文本生成事实完备性评价基准
  2. 1日前

    【第718期】大语言模型中的全球工作空间:可言语化表征研究

    今天的这篇的主题是:Verbalizable Representations Form a Global Workspace in Language ModelsSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 在人类大脑处理的所有信息中,只有一小部分是能被意识到的,即能够用于口头报告、深思熟虑的控制以及灵活推理的信息。在本文中,我们提出证据表明,大型语言模型中也出现了类似的内部功能区分。利用一种全新的可解释性技术——雅可比透镜(Jacobian lens),我们识别出了模型在处理过程中的任意节点准备表达出的表征。这些表征被我们统称为 J 空间(J-space),它们展现出了全局工作空间(global workspace)所特有的功能属性:其内容可以被报告、被故意召唤和保持、用于承担隐蔽推理的中间步骤,并作为参数传递给任意下游计算;而文本解析和例行推理等自动处理过程则在无需它们参与的情况下 proceed(进行)。J 空间还具备全局工作空间理论与意识接入(conscious access)相联系的结构特征:它仅在中间层级带中承载连贯的内容,一次可容纳数十个概念数量级的知识,并且相比其他表征,它被模型的权重更为广泛地广播。这些特性使其成为了观察模型未说出的思考过程的实用窗口。在对齐审计中,它揭示了模型从未在其最终输出中呈现出的策略性深思、评估意识,以及训练所引入的不对齐倾向。我们发现,后训练(post-training)将“助手”(Assistant)的视角植入了该工作空间中,据此我们引入了逆事实反思训练(counterfactual reflection training),该方法仅通过训练模型在被中断并要求反思时会说些什么,就提升了其行为表现。这些结果表明,语言模型维持着一小部分具有意识接入某些功能特征的特权表征,而解码这些表征能够为揭示其持续进行的认知过程提供新的视角。 原文链接:https://arxiv.org/abs/2607.15495 前往小宇宙评论区与主播互动

    【第718期】大语言模型中的全球工作空间:可言语化表征研究
  3. 2日前

    【第717期】PRO-LONG:程序化记忆助力长程推理

    今天的这篇的主题是:Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 长视角(Long-horizon)任务需要持续的感知、推理与探索,这对于大型语言模型(LLM)Agent 而言是一项持久的挑战。这一差距体现在它们于 ARC-AGI-3 等持续学习基准测试中有限的表现上,尤其是当对模型进行开箱即用的评估时。为了弥合这一差距,业界提出了各种 Agent 框架(harnesses),且每种框架都致力于采用一种特定的长序列观察处理策略,即:从环境中保存什么信息,以及如何将其加载到模型上下文中——我们认为这一选择尤为关键。现有的上下文管理方法面临着显著的权衡取舍,因为保存越多的信息,检索相关细节的难度就越大。我们提出了 PRO-LONG,这是一个围绕程序化记忆构建的极简上下文管理框架,专为处于长视角、探索性设定下的 LLM Agent 设计。PRO-LONG 通过维护完整且结构化的交互日志,并借助编程 Agent 近期的进展来高效检索该历史记录,从而解决了这一权衡难题。在完整的 ARC-AGI-3 公开游戏集上,PRO-LONG 在前沿模型上的表现相比基础编程 Agent 平均提升了 18.0 个百分点,且在 token 消耗减少 4.2 至 5.8 倍的同时,达到或超越了最先进的专用框架(pass@1 最高达 76.1%)。配合 Fable 5,PRO-LONG 以 1,750 美元的总成本实现了 97.4% 的 best@2 成绩。 原文链接:https://arxiv.org/abs/2607.20064 前往小宇宙评论区与主播互动

    【第717期】PRO-LONG:程序化记忆助力长程推理
  4. 3日前

    【第716期】从记忆到技能:长程大语言模型智能体的循证协同演化治理

    今天的这篇的主题是:From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM AgentsSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 用于长上下文 LLM Agent 的现有记忆系统通常将先前的轨迹作为被动上下文进行检索,而不是将其转化为可执行的能力。在本文中,我们提出了 MSCE,这是一个无需训练的“记忆-技能共进化”(Memory--Skill Co-Evolution)框架,它将 Agent 的经验组织为有据可查的步骤轨迹、可复用的程序性策略,以及宣告性的环境认知。MSCE 将具有估计正增益的、有证据支持的 L2 策略凝练为可调用的技能,这些技能保留了证据链接、适用性边界、决策指导、验证规则以及可靠性估计。此外,它还引入了基于反思权重的价值反向填补(reflection-weighted value backfilling),该机制通过密集的局部自我反思来传播稀疏的终端反馈,从而生成经过证据校准的轨迹价值,用于管理记忆与技能的进化。在 EvoAgentBench 和 LoCoMo 上的实验表明,MSCE 显著优于最先进的技能增强型和记忆驱动型 Agent 基线,展现出了强大的跨领域迁移能力和终身进化能力。 原文链接:https://arxiv.org/abs/2607.16621 前往小宇宙评论区与主播互动

    【第716期】从记忆到技能:长程大语言模型智能体的循证协同演化治理
  5. 4日前

    【第715期】Harness Handbook:AI智能体框架行为化表征指南

    今天的这篇的主题是:Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and EditableSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 现代 AI Agent 的能力不仅取决于其基础模型,还取决于其 Harness(调度/治理框架)——后者负责构建 Prompt、管理状态、调用工具并协调执行过程。随着模型、API、环境和需求的不断演进,Harness 必须随之持续修改。在实施此类修改之前,开发者或编码 Agent 必须定位到实现目标行为的所有代码位置。这一过程十分困难,因为生产级 Harness 通常体量庞大、高度耦合且行为逻辑分散,而修改需求往往描述的是系统“应该做什么”,代码库却是按文件和模块组织的。代码搜索、代码库索引以及长上下文处理虽然减轻了查阅负担,但这种“行为到代码”的映射依然需要人工来恢复。因此,行为定位(Behavior localization) 成了 Harness 演进过程中的核心瓶颈。 为此,我们引入了 Harness Handbook(Harness 手册):一种通过静态分析与 LLM 辅助结构化从 Harness 代码库中自动合成的以行为为中心的表征,它将每种行为与其对应的源码进行了关联。 我们还提出了 行为引导渐进式揭示(Behavior-Guided Progressive Disclosure, BGPD) 机制,该机制能够引导 Agent 从高层行为逐步深入到相关的实现细节,并根据当前源码验证候选代码位置。 在来自两个开源 Harness 的多样化修改需求测试中,基于手册辅助的规划(Handbook-Assisted planning)在减少规划器 Token 消耗的同时,提高了行为定位与修改计划的质量;其中,收益最显著的场景包括:分散的代码位置、罕见执行路径以及跨模块交互。 因此,演进复杂的 Agentic 系统不仅取决于生成修改代码,还取决于准确确定这些修改应当施加在何处。 原文链接:https://arxiv.org/abs/2607.13285 前往小宇宙评论区与主播互动

    【第715期】Harness Handbook:AI智能体框架行为化表征指南
  6. 5日前

    【粉丝投稿001期】HydroGym:流体力学强化学习通用平台

    今天的这篇的主题是: The HydroGym reinforcement learning platform for fluid dynamics Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:eccstartup(加群/投稿论文) Summary 流体流动的有效控制在交通运输、能源和医学领域至关重要,它可以增加升力、降低阻力、增强混合并衰减噪声¹⁻³。然而,流体控制极其困难,因为它们涉及高维、非线性和多尺度的动态特性,这些特性使得传统方法难以奏效⁴⁻⁶。强化学习在蛋白质折叠和复杂游戏等领域推动了显著的进展,这些领域拥有共享的基准测试和标准化的环境⁷⁻¹⁰。流体力学一直缺乏此类基础设施,因此每个控制器通常仅针对单一的几何形状和运行条件进行调优,导致研究进展难以积累、迁移和比较¹¹⁻¹³。 在本文中,我们推出了 HydroGym,这是一个独立于求解器的强化学习平台,提供了 60 多个经过验证且公开可用的流体控制环境。这些环境涵盖了从典范的层流到复杂的湍流,雷诺数(Reynolds number)系统性地跨越至 Re=4×105,并包含二维和三维空间中的马赫数(Mach number)变化。 在这些环境中,Agent(智能体)重复发现了稳健的控制原理,包括边界层操控、声学反馈中断以及湍流尾流重构。至关重要的是,我们展示了零样本迁移(zero-shot transfer)的概念验证:仅在低成本替代环境中训练的 Agent 被直接部署到具挑战性的真实场景中(如三维翼型截面)。在与直接在翼型上进行优化的方案相比时,我们在将探索成本降低四个数量级的同时,实现了局部皮细摩擦力(skin friction)38% 的降低。由于这种迁移利用了共享的近壁面物理特性,其泛化的广度仍有探索空间,这为跨越计算成本高昂的模拟环境开展策略泛化研究提供了一条全新路径。通过提供一个通用且具扩展性的可复现研究基础,HydroGym 将流体控制研究从孤立的个案研究推向了凝聚的社区合作努力。 原文链接:https://www.nature.com/articles/s41586-026-10917-6 前往小宇宙评论区与主播互动

  7. 5日前

    【第714期】ProxyMark:基于代理陷阱与流量水印的门罗币Tor节点去匿名化研究

    今天的这篇的主题是:Deanonymizing Monero Transactions in Tor NetworkSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary Monero(门罗币)是一种注重隐私的加密货币,它部署了 Dandelion++ 协议并集成了匿名网络(如 Tor 和 I2P),以防止恶意攻击者将交易与其源 IP 地址关联起来。在本文中,我们证明了 Monero 对 Tor 网络的集成引入了一个根本性的漏洞:Monero Tor 节点发起的交易在进入明网(clearnet)传播之前,会排他性地转发给两个出站 Tor 隐蔽服务节点(代理节点);这使得攻击者能够通过占据目标节点的出站连接来捕获其发起的交易。 基于这一发现,我们提出了 ProxyMark——一个针对 Monero Tor 网络的威胁拓扑三阶段去匿名化框架,包含: 节点角色识别 源发起交易识别 节点位置去匿名化 通过在 live Tor 网络、Monero 主网和测试网上的实验,我们从实证角度证明了 ProxyMark 在成功去匿名化经由 Tor 发起的 Monero 节点交易方面的有效性。 原文链接:https://arxiv.org/abs/2607.07062 前往小宇宙评论区与主播互动

  8. 6日前

    【第713期】LingBot-World-Infinity:无限交互式现实世界模拟器

    今天的这篇的主题是:Infinite Worlds with Versatile InteractionsSeventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。 如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。 联系小助手微信:seventy3_podcast(加群/投稿论文) Summary 我们推出了 LingBot-World 2.0(亦称 LingBot-World-Infinity),这是 LingBot-World 的高级迭代版本,带来四大显著升级: 无界交互视角/时长:得益于精心设计的因果预训练范式(causal pretraining paradigm),我们的模型在保持输出质量一致性的同时,实现了无限延展的交互时长。 实时流化响应:通过从基座模型蒸馏出一个实时变体,系统保证了极快的响应速度,足以驱动 60 fps 的 720p 视频流。 丰富交互元素:与上一版本相比,本次更新引入了高度多样化的交互元素,涵盖更广泛的动作形态(如攻击、拉弓射箭、施法和射击),以及种类更丰富的文本驱动事件。 Agentic Harness 编排框架:我们开创性地将 Agent 治理框架(agentic harness)引入世界建模(world modeling)领域——其中,驾驶员 Agent(pilot agent)负责规划并执行角色行为,而导演 Agent(director agent)则负责随着场景的推进合成全新的环境元素。 此外,为了便于多人共享体验,我们开发了一个支持多名玩家同时沉浸于这一生动世界模拟器中的交互接口。我们还将主力的 14B 模型与轻量化的 1.3B 模型进行搭配,后者支持在单张 GPU 上进行轻松部署。 原文链接:https://arxiv.org/abs/2607.07534 前往小宇宙评论区与主播互动

    【第713期】LingBot-World-Infinity:无限交互式现实世界模拟器

關於

73播客,Sheldon最喜欢的数字,内容均为Google NotebookLM原生生成,每天由AI领读最新的前沿论文。欢迎投稿合作。

你可能也會喜歡