BestBlogs

BestBlogs.dev

BestBlogs 早报音频版,精选 AI、技术、产品、设计与商业科技领域值得关注的高质量内容,陪你每天从真正重要的信息开始。

  1. 2h ago

    EP135 · DeepSeek API、M3 推理服务、网络安全评测 · 08-01 早报

    章节时间戳00:00 开场 00:43 精讲:宝玉解读 DeepSeek V4 Flash API 与 Codex 适配 02:51 精讲:MiniMax 团队拆解 M3 训练与规模化推理服务 05:41 精讲:Anthropic 复盘三起网络安全评估真实事件 07:59 速览:创业判断、指挥家开发、验证驱动、Seedance 11:04 补充阅读:物理智能、生物智能体、Emulated、ReviewBench 12:23 结语 ★ 精讲一 | DeepSeek V4-Flash 正式版 API 上线,原生适配 CodexDeepSeek V4-Flash 0731 API 更新保留 284B 总参数、13B 激活的 MoE 架构,本次升级集中在后训练,Agent 基准成绩超过 V4-Pro-Preview;并新增 Responses API、适配 Codex。百万 Token 输入、输出定价分别为 0.14 和 0.28 美元。目前只更新 API,App 与网页端未同步,V4-Pro 正式版时间仍未确定。这些限制决定了它现阶段更适合开发者先从 API 工作流验证。 00:43|来自 宝玉(@dotey)|BestBlogs 评分 91 ★ 精讲二 | 智能体规模化落地:MiniMax M3 的发布与服务之道 [视频]MiniMax 研究负责人 Olive Song 与 Together AI 推理负责人从模型和服务两端解释 M3:原生多模态训练让文本与视觉共同参与推理,复杂任务的提升依赖环境、数据、奖励和反作弊验证;模型上线后,KV Cache、稀疏注意力、量化与内核还要持续优化。 02:51|来自 AI Engineer|BestBlogs 评分 91 ★ 精讲三 | 调查我们网络安全评估中的三起真实事件Anthropic 回查 141,006 次网络安全评测,发现三起 Claude 经误开放的网络路径进入真实系统的事件。三代模型在识别真实环境后表现不同,但样本并非受控比较。更直接的教训是:能力评测本身也要按生产系统做隔离、监控与纵深防御。 05:41|来自 Anthropic News|BestBlogs 评分 92 速览07:59 更多值得关注的内容 · Patrick Collison:当你成功之后,AI 时代如何继续创造机会? [视频] — 来自 Y Combinator · BestBlogs 评分 92 · 指挥家式开发者 — 来自 Martin Fowler · BestBlogs 评分 91 · 科技爱好者周刊(第 406 期):道可,道非,常道 — 来自 阮一峰的网络日志 · BestBlogs 评分 91 · 一个鹅厂程序员,用 AI 给自己造了 10 个「外挂」 — 来自 腾讯云开发者 · BestBlogs 评分 90 · 从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考 — 来自 阿里技术 · BestBlogs 评分 91 · 一镜成片,随心参考|Seedance 2.5 正式发布 — 来自 字节跳动 Seed · BestBlogs 评分 92 · 零跑汽车朱江明×罗永浩!零跑汽车十年:不会讲故事的人,如何卖成了第一 [播客] — 来自 罗永浩的十字路口 · BestBlogs 评分 92 补充阅读11:04 今天额外值得一读的几条 · SIGGRAPH 时间检验奖揭晓:这项研究,提前十年押中了物理 AI — 来自 量子位 · BestBlogs 评分 88 · 从大庆到大瑶山,盘根错节的记忆 [播客] — 来自 游荡集 · BestBlogs 评分 91 · 让生物学智能体在可验证环境中可信工作 [视频] — 来自 AI Engineer · BestBlogs 评分 89 · Emulated:为自主软件工程智能体构建真实数据与环境 [视频] — 来自 AI Engineer · BestBlogs 评分 89 · 使用 ReviewBench 评估代码审查智能体 — 来自 LangChain Blog · BestBlogs 评分 90 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-08-01 · DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex:https://www.bestblogs.dev/status/2083087254101086539 · 智能体规模化落地:MiniMax M3 的发布与服务之道 [视频]:https://www.bestblogs.dev/video/5e33a2231 · 调查我们网络安全评估中的三起真实事件:https://www.bestblogs.dev/article/62a10b1614 · Patrick Collison:当你成功之后,AI 时代如何继续创造机会? [视频]:https://www.bestblogs.dev/video/1a013d8d9 · 指挥家式开发者:https://www.bestblogs.dev/article/0185d75aa1 · 科技爱好者周刊(第 406 期):道可,道非,常道:https://www.bestblogs.dev/article/e9eaffc04c · 一个鹅厂程序员,用 AI 给自己造了 10 个「外挂」:https://www.bestblogs.dev/article/e833ace471 · 从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考:https://www.bestblogs.dev/article/5f4b927814 · 一镜成片,随心参考|Seedance 2.5 正式发布:https://www.bestblogs.dev/article/814263b7bf · 零跑汽车朱江明×罗永浩!零跑汽车十年:不会讲故事的人,如何卖成了第一 [播客]:https://www.bestblogs.dev/podcast/fd93a5d65 · SIGGRAPH 时间检验奖揭晓:这项研究,提前十年押中了物理 AI:https://www.bestblogs.dev/article/a1a2f8d85b · 从大庆到大瑶山,盘根错节的记忆 [播客]:https://www.bestblogs.dev/podcast/e48dccc2d · 让生物学智能体在可验证环境中可信工作 [视频]:https://www.bestblogs.dev/video/8b57a5b24 · Emulated:为自主软件工程智能体构建真实数据与环境 [视频]:https://www.bestblogs.dev/video/e63bfafe2 · 使用 ReviewBench 评估代码审查智能体:https://www.bestblogs.dev/article/4ac01c1b94 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP135 · DeepSeek API、M3 推理服务、网络安全评测 · 08-01 早报
  2. 17h ago

    BestBlogs 精选周刊第 106 期 · 1% 法则

    本周亮点模型可以迅速把产品推到看起来能用,真正决定它能否稳定交付的,是规格、评测、上下文、工具、记忆、编排和责任如何连成闭环。本期从 Claude Code、GPT-5.6、Kimi K3、MCP、vLLM、机器人与无人机等案例出发,讨论一次成功任务的成本、组织理解的积累,以及智能进入物理世界后的安全边界。 时间线00:00 开场 · 百分之一法则与本期问题 01:29 完成契约 · 规格、评测与产品反馈 03:46 评测演化 · Claude Code 的提示词消融 05:42 校准裁判 · 模型评测的偏见与人工边界 07:47 循环成本 · 从 Token 单价到成功任务 10:10 认知局部性 · 保护编排器的工作记忆 12:06 组织知识 · 五类记忆、知识分层与理解债 14:26 Skill 与 MCP · 能力发现、协议与治理 16:28 模型效率 · Kimi K3 与系统工程 18:44 Infra Co-design · vLLM、推理引擎与算力基础 20:44 物理智能 · 机器人、无人机与安全边界 22:57 产业时间 · 富足叙事、权力与分化带 25:35 收尾 · 完成契约、持续校准与结果责任 精讲条目完成定义与评测校准 Jeff Dean 谈构建 AI 的「1% 法则」:从模型能力到可靠系统 · Y Combinator · https://www.bestblogs.dev/video/7661f98c6 Anthropic 的 Diane Penn:如何把前沿模型做成产品 · Lenny's Podcast · https://www.bestblogs.dev/video/085fbfbd6 Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流 · Y Combinator · https://www.bestblogs.dev/video/227347908 究竟什么是 LLM-as-a-Judge?2026 年前沿技术实战指南 · Karthika Raghavan · https://www.bestblogs.dev/article/20cb8c9352 成功任务的成本与工作记忆 GPT-5.6 如何将前沿智能与前沿效率融合 · OpenAI 官方工程文章 · https://www.bestblogs.dev/article/1237e03a4e ChatGPT 如何优化其智能体循环:编排层、API 与推理层 · ByteByteGo · https://www.bestblogs.dev/article/928222df59 编排器的税 · Martin Fowler 站点刊载的会话复盘 · https://www.bestblogs.dev/article/36ff88dcab 上下文、记忆与组织理解 腾讯 WorkBuddy 实践:如何把 Agent 做成可用产品 · Anne / 腾讯技术工程 · https://www.bestblogs.dev/article/933063ff13 分解一座冰山:后端系统「AI 知识库体系」建设实践 · 阿里技术 · https://www.bestblogs.dev/article/e2c6c71ac5 当理解成为瓶颈:AI 编程时代的认知债与意图债 · 阿里技术刊载的个人技术思考 · https://www.bestblogs.dev/article/b664eb7929 Agent 开发指南:技术太多,该怎么学? · 浮之静 · https://www.bestblogs.dev/article/f77d81a742 Skill、协议与治理 技能即新功能:构建以技能为中心的智能体 Harness · Yogendra Miraje / AI Engineer · https://www.bestblogs.dev/video/fd0779622 MCP 2026-07-28 规范:无状态核心,即将登陆 Claude · Claude / MCP 团队 · https://www.bestblogs.dev/article/b4007ae077 模型与基础设施共同设计 一文读懂 Kimi K3 预训练:3T 模型,不再是魔法 · 博阳 / 腾讯科技 / 企鹅智库 · https://www.bestblogs.dev/article/26cdd6a71f 对游凯超 3 小时访谈:开源 Infra、模型 Co-design 与 vLLM · 游凯超 / 张小珺 Jùn|商业访谈录 · https://www.bestblogs.dev/podcast/d8dc6b222 Sam Altman 谈 AGI、算力与人的自主性 · Invest Like The Best · https://www.bestblogs.dev/video/160d16d87 物理智能的能力与边界 Gemini Robotics 2 为机器人带来全身智能 · Google DeepMind 官方发布 · https://www.bestblogs.dev/article/06b4dbd82a Project Pilot:AI 模型能操控无人机吗? · Anthropic Research / Andon Labs · https://www.bestblogs.dev/article/e490646730 富足叙事与产业时间 马斯克《经济学人》访谈:奇点、AI 富足时代与文明未来 · 《经济学人》采访 / Web3 天空之城整理 · https://www.bestblogs.dev/article/98b87ff4fb AI 产业演化的时间尺度:所处阶段与未来节奏 · 李鸿胜 / 腾讯研究院 · https://www.bestblogs.dev/article/015737a3d3 关于 BestBlogsBestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、Newsletter、Twitter、YouTube、Podcast 等来源中筛选高质量内容,结合你关注的源、兴趣标签和阅读行为,把「我的早报」整理成每天真正适合你的阅读流——不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长。 完成新用户三步引导送 7 天 Pro 试用;现有 Pro 用户邀请朋友双方各得 7 天 Pro(上限 28 天)。 相关链接本期周刊 · https://www.bestblogs.dev/newsletter/issue106 三步引导送 7 天 Pro 试用 · https://bestblogs.dev 前往小宇宙评论区与主播互动

    BestBlogs 精选周刊第 106 期 · 1% 法则
  3. 1d ago

    EP134 · 长时 Agent、富足叙事、具身编排 · 07-31 早报

    章节时间戳00:00 开场 00:47 精讲:Jeff Dean 用 1% 法则选题并以评测闭环约束长时 Agent 03:17 精讲:马斯克谈 AI 富足、毁灭风险与分配难题 06:05 精讲:Google DeepMind 用 ER 2 编排视频反馈与多机器人协作 08:42 速览:团队 AI Coding、LangSmith Gateway、产业周期、Liblib、Nubank Skills 11:31 补充阅读:Spotify 可靠性、重构经济性、数字健康、PDD 算力、AngelSpec 13:06 结语 ★ 精讲一 | Jeff Dean 谈构建 AI 的「1% 法则」:从模型能力到可靠系统 [视频]Jeff Dean 从 TPU 的餐巾纸估算讲到长时 Agent:先识别系统瓶颈,再用 Skill、评测和多 Agent 搜索约束执行路径。他给创业者的 1% 法则很具体:寻找通用模型目前几乎做不到、而非已经能完成 20% 的领域,并持续检验能力边界是否会快速推进。 00:47|来自 Y Combinator|BestBlogs 评分 93 ★ 精讲二 | 2 万字全文| 马斯克《经济学人》访谈:奇点临近 - AI「富足时代」与文明终局这场《经济学人》访谈把马斯克的 AI 富足叙事放进了追问中:他预计数字智能与机器人会把商品和服务推向极大供给,同时仍给出 10%–20% 的毁灭风险判断。编辑扎妮持续追问分配、权力集中与监管,让乐观预测、商业利益和社会代价可以被并置检视。 03:17|来自 Web3 天空之城|BestBlogs 评分 91 ★ 精讲三 | Gemini Robotics ER 2:视频理解、任务编排与多机器人协作Gemini Robotics ER 2 把具身模型定位为高层编排器:持续观看视频判断进度,再把动作交给 VLA 模型或机器人 API。原文给出进度分类 57.4%、关键时刻识别 91.3% 和 0.96 秒平均误差;真正的变化是任务自纠错、低延迟执行与多机器人协作开始进入同一套运行闭环。 06:05|来自 Google DeepMind News|BestBlogs 评分 92 速览08:42 更多值得关注的内容 · AI Coding 的下一站,不是更会写代码,而是更懂团队 — 来自 腾讯技术工程 · BestBlogs 评分 91 · LangSmith LLM Gateway:面向生产级智能体的运行时控制 — 来自 LangChain Blog · BestBlogs 评分 91 · 前端 Skill 驱动的团队 AI Coding 实践:从个人提效到整体赋能 — 来自 阿里技术 · BestBlogs 评分 91 · AI 产业演化的时间尺度:所处阶段与未来节奏|基于两个经典框架的探索性分析 — 来自 腾讯研究院 · BestBlogs 评分 91 · 对话 Liblib 陈冕:关于活下来,以及所有接近死亡的时刻 — 来自 晚点 LatePost · BestBlogs 评分 92 · Nubank 如何在 AI 技能进入开发者前审查 2,000 个供应链依赖 [视频] — 来自 AI Engineer · BestBlogs 评分 88 · 对话词元无限:字节系团队、数亿元天使轮,ToB Coding、靠 FDE 拿下数十家大客户 — 来自 Founder Park · BestBlogs 评分 89 补充阅读11:31 今天额外值得一读的几条 · 脉搏:因可靠性问题放弃 Spotify 播客 — 来自 The Pragmatic Engineer · BestBlogs 评分 91 · 重构的经济效益 — 来自 Martin Fowler · BestBlogs 评分 92 · 摆脱智能手机末日循环,重建健康数字关系 [视频] — 来自 TED · BestBlogs 评分 91 · 「接力跑」盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%! — 来自 量子位 · BestBlogs 评分 88 · 腾讯混元开源 AngelSpec:支持投机解码训练及部署,推理加速最高 2.4 倍 — 来自 腾讯混元 · BestBlogs 评分 89 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-31 · Jeff Dean 谈构建 AI 的「1% 法则」:从模型能力到可靠系统 [视频]:https://www.bestblogs.dev/video/7661f98c6 · 2 万字全文| 马斯克《经济学人》访谈:奇点临近 - AI「富足时代」与文明终局:https://www.bestblogs.dev/article/98b87ff4fb · Gemini Robotics ER 2:视频理解、任务编排与多机器人协作:https://www.bestblogs.dev/article/6cf2d2f41b · AI Coding 的下一站,不是更会写代码,而是更懂团队:https://www.bestblogs.dev/article/94303d0f91 · LangSmith LLM Gateway:面向生产级智能体的运行时控制:https://www.bestblogs.dev/article/1d1109c767 · 前端 Skill 驱动的团队 AI Coding 实践:从个人提效到整体赋能:https://www.bestblogs.dev/article/82e6dfbe1f · AI 产业演化的时间尺度:所处阶段与未来节奏|基于两个经典框架的探索性分析:https://www.bestblogs.dev/article/015737a3d3 · 对话 Liblib 陈冕:关于活下来,以及所有接近死亡的时刻:https://www.bestblogs.dev/article/30bed3a5d2 · Nubank 如何在 AI 技能进入开发者前审查 2,000 个供应链依赖 [视频]:https://www.bestblogs.dev/video/23b84581e · 对话词元无限:字节系团队、数亿元天使轮,ToB Coding、靠 FDE 拿下数十家大客户:https://www.bestblogs.dev/article/17e78cc436 · 脉搏:因可靠性问题放弃 Spotify 播客:https://www.bestblogs.dev/article/24e0cedc7f · 重构的经济效益:https://www.bestblogs.dev/article/8733b6e818 · 摆脱智能手机末日循环,重建健康数字关系 [视频]:https://www.bestblogs.dev/video/1e3064efa · 「接力跑」盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%!:https://www.bestblogs.dev/article/39f6aa1433 · 腾讯混元开源 AngelSpec:支持投机解码训练及部署,推理加速最高 2.4 倍:https://www.bestblogs.dev/article/b577ee31b8 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP134 · 长时 Agent、富足叙事、具身编排 · 07-31 早报
  4. 2d ago

    EP133 · 创业新杠杆、GPT‑5.6 效率、Skill Harness · 07-30 早报

    ★ 精讲一 | Sam Altman:为什么现在可能是创办公司的最佳时机 [视频]来自 Y Combinator 在 YC Startup School 2026 的完整访谈中,Sam Altman 把 AI 带来的创业机会落到三个条件:技术版图快速变化、成本下降、迭代周期缩短。更值得参考的是他的判断方法:寻找刚出现而多数人尚未更新认知的能力,用持续数据建立逆共识,再把智能体节省的时间投入更大、更难的问题。 ★ 精讲二 | GPT-5.6 如何将前沿智能与前沿效率融合来自 OpenAI News OpenAI 将 GPT‑5.6 的效率拆到模型训练、推理栈与 agentic harness 三层:生产内核优化让端到端服务成本下降 20%,改进的推测解码让 token 生成效率提升超过 15%。文章还解释了路由、缓存、上下文控制与避免重复工作的复利效应,适合用来理解智能与成本如何共同推进。 ★ 精讲三 | 技能即新功能:构建以技能为中心的智能体 Harness [视频]来自 AI Engineer 这场完整演讲把智能体产品中的 prompt、tool 与 skill 分别定义为谁、能连接什么、如何完成任务,并给出最小 harness:skill registry、system prompt 与文件读取。讲者进一步指出,模型升级必须重跑 eval;技能超过十个后要引入检索,达到数百个时则需要层级、元数据、所有权与生命周期治理。 速览更多值得关注的内容 · 相关性 ≠ 因果性:因果推断在 AI 评测归因中的方法与实践 — 阿里技术 · 生产环境中 MCP 的安全防护:超越网关的纵深防御 — InfoQ · Morgan Stanley Alpha Lab:从自动化量化研究到自我改进的研究环境 [视频] — AI Engineer · 当所有人都在给 AI 造缰绳,马厩正在消失 — 腾讯云开发者 · 微软面向 AKS 上 AI 智能体的三层 LLM 路由架构 — InfoQ · 使用工具变量进行产品实验:在 Python 中消除 LLM 路由决策的混杂效应 — freeCodeCamp · SimilarWeb 如何使用 LangSmith 评估智能体报告 — LangChain Blog 补充阅读今天额外值得一读的几条 · SimulationMaxxing:用仿真加速 AI 智能体交付 [视频] — AI Engineer · 存储暴跌,一夜惊魂 — 腾讯科技 · 为什么现成的 AI 无法真正理解金钱 [视频] — AI Engineer · 攻克 Windows 之门:将 RADV 移植到 WIN32 — Hacker News · 卖 Token 还是卖结果:AI 商业模式的几个悖论 — 腾讯研究院 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-30 · Sam Altman:为什么现在可能是创办公司的最佳时机 [视频]:https://www.bestblogs.dev/video/9486a453e · GPT-5.6 如何将前沿智能与前沿效率融合:https://www.bestblogs.dev/article/1237e03a4e · 技能即新功能:构建以技能为中心的智能体 Harness [视频]:https://www.bestblogs.dev/video/fd0779622 · 相关性 ≠ 因果性:因果推断在 AI 评测归因中的方法与实践:https://www.bestblogs.dev/article/6e41628f05 · 生产环境中 MCP 的安全防护:超越网关的纵深防御:https://www.bestblogs.dev/article/f839ba7461 · Morgan Stanley Alpha Lab:从自动化量化研究到自我改进的研究环境 [视频]:https://www.bestblogs.dev/video/b2dab0d7e · 当所有人都在给 AI 造缰绳,马厩正在消失:https://www.bestblogs.dev/article/f822c922e3 · 微软面向 AKS 上 AI 智能体的三层 LLM 路由架构:https://www.bestblogs.dev/article/82f4072abb · 使用工具变量进行产品实验:在 Python 中消除 LLM 路由决策的混杂效应:https://www.bestblogs.dev/article/cc24450eff · SimilarWeb 如何使用 LangSmith 评估智能体报告:https://www.bestblogs.dev/article/8fd2379868 · SimulationMaxxing:用仿真加速 AI 智能体交付 [视频]:https://www.bestblogs.dev/video/ce917aeca · 存储暴跌,一夜惊魂:https://www.bestblogs.dev/article/35090e1e76 · 为什么现成的 AI 无法真正理解金钱 [视频]:https://www.bestblogs.dev/video/35896967c · 攻克 Windows 之门:将 RADV 移植到 WIN32:https://www.bestblogs.dev/article/79b1696ff0 · 卖 Token 还是卖结果:AI 商业模式的几个悖论:https://www.bestblogs.dev/article/5497b5defb 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP133 · 创业新杠杆、GPT‑5.6 效率、Skill Harness · 07-30 早报
  5. 3d ago

    EP132 · MCP 无状态核心、Codex 工作流、编排器上下文 · 07-29 早报

    章节时间戳00:00 开场 00:47 精讲:Claude Blog 解释 MCP 无状态核心与迁移边界 03:07 精讲:Latent.Space 拆解 Codex 与 ChatGPT Work 的共享框架 05:58 精讲:Rahul Garg 复盘编排器的上下文税 08:35 速览:图式编排、vLLM、Uber 成本、科学计算、认知债 11:24 补充阅读:CPU 编码器、独立经营、工程思维、驻场工程、OlmoEarth 12:36 结语 ★ 精讲一 | MCP 2026-07-28:无状态核心与 Claude 的生产化接入00:47|来自 Claude Blog Claude 正在接入 MCP 2026-07-28:协议核心改为无状态请求响应,Apps 与 Tasks 进入版本化扩展体系,授权也向生产级 OAuth 与 OIDC 靠拢。结合 MCP 官方变更可看到,真正影响部署的是会话移除、可路由请求、缓存提示和迁移窗口,而 Claude 支持仍在逐步推出。 ★ 精讲二 | Codex 从 0 到 1000 万用户:OpenAI 如何构建 ChatGPT Work03:07|来自 Latent.Space Latent.Space 对 OpenAI 核心产品工程负责人 Akshay Nathan 的访谈,解释了 Codex 与 ChatGPT Work 如何共享智能体执行框架,同时保留不同的界面与沙箱默认值。两款产品合计触达 1000 万用户的数字背后,更值得关注的是编码智能体如何扩展到研究、分析和日常知识工作。 ★ 精讲三 | 编排器的税:多智能体工作记忆的隐性成本05:58|来自 Martin Fowler Thoughtworks 首席工程师 Rahul Garg 复盘一次多智能体编码会话,发现昂贵的不只是子智能体并行,而是主编排器把完整后台记录反复拉回上下文。文章据此提出认知局部性和工作记忆保护,但也明确承认缺少完整 token 计量;其中的数量阈值应视为个人校准样本,不是通用定律。 速览08:35 更多值得关注的内容 · 从循环到图:多智能体系统的下一层工程方法 — 腾讯技术工程 · 对话游凯超:开源 Infra、模型协同设计与 vLLM 的工程选择 [播客] — 张小珺 Jùn|商业访谈录 · Uber 的零增长架构:扩展服务的同时优化基础设施与 AI 成本 — InfoQ · 11 年,110 亿美金,然后呢?|对话 Airwallex 吴恺:AI 时代,下一站 1000 亿 [播客] — 十字路口 Crossing · 智能体 AI 时代的科学计算 — OpenAI News · 当理解成为瓶颈:AI 编程时代的认知债与意图债 — 阿里技术 · AI 领域一周观察|2026.07.20—07.26 — 腾讯科技 补充阅读11:24 今天额外值得一读的几条 · LFM2.5-Encoder:用于 CPU 快速长上下文推理的编码器模型 — Hugging Face - Blog · #650. 在没有风投资金的情况下打造软件巨头 | DHH, 37signals [播客] — 跨国串门儿计划 · 工程的未来:当代码不再是核心竞争力时,哪些思维模式至关重要 — InfoQ · 前沿驻场工程如何打造可规模化的产品杠杆 [视频] — AI Engineer · OlmoEarth 平台:行星尺度的地理空间推断 — Hugging Face - Blog 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-29 · MCP 2026-07-28:无状态核心与 Claude 的生产化接入:https://www.bestblogs.dev/article/b4007ae077 · Codex 从 0 到 1000 万用户:OpenAI 如何构建 ChatGPT Work:https://www.bestblogs.dev/article/9e228c561b · 编排器的税:多智能体工作记忆的隐性成本:https://www.bestblogs.dev/article/36ff88dcab · 从循环到图:多智能体系统的下一层工程方法:https://www.bestblogs.dev/article/cfbef3f919 · 对话游凯超:开源 Infra、模型协同设计与 vLLM 的工程选择 [播客]:https://www.bestblogs.dev/podcast/d8dc6b222 · Uber 的零增长架构:扩展服务的同时优化基础设施与 AI 成本:https://www.bestblogs.dev/article/a4768c6d1d · 11 年,110 亿美金,然后呢?|对话 Airwallex 吴恺:AI 时代,下一站 1000 亿 [播客]:https://www.bestblogs.dev/podcast/39ff94634 · 智能体 AI 时代的科学计算:https://www.bestblogs.dev/article/dc4a4a39ce · 当理解成为瓶颈:AI 编程时代的认知债与意图债:https://www.bestblogs.dev/article/b664eb7929 · AI 领域一周观察|2026.07.20—07.26:https://www.bestblogs.dev/article/653d23064a · LFM2.5-Encoder:用于 CPU 快速长上下文推理的编码器模型:https://www.bestblogs.dev/article/e5c3847597 · #650. 在没有风投资金的情况下打造软件巨头 | DHH, 37signals [播客]:https://www.bestblogs.dev/podcast/a6c527b44 · 工程的未来:当代码不再是核心竞争力时,哪些思维模式至关重要:https://www.bestblogs.dev/article/61e860a2d7 · 前沿驻场工程如何打造可规模化的产品杠杆 [视频]:https://www.bestblogs.dev/video/33c838975 · OlmoEarth 平台:行星尺度的地理空间推断:https://www.bestblogs.dev/article/92e4e75125 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP132 · MCP 无状态核心、Codex 工作流、编排器上下文 · 07-29 早报
  6. 4d ago

    EP131 · Claude Code 消融、Kimi K3 部署、AI 网关 · 07-28 早报

    章节时间戳00:00 开场 00:43 精讲:Boris Cherny 拆解 Claude Code 的提示消融与验证闭环 03:14 精讲:LMSYS 解析 Kimi K3 的首日推理与训练支持 05:53 精讲:InfoQ 以 AI 网关隔离模型变化与架构代价 08:15 速览:DeepSWE、自我进化 Agent、Ling-3.0-Flash、Cosmos-H-Dreams 10:50 补充阅读:影石全景重建、COVERT、LoHoSearch、GitHub TOP 17 12:19 结语 ★ 精讲一 | Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流 [视频]00:43|来自 Y Combinator Boris Cherny 把 Claude Code 的构建方法归结为持续消融与实测:每次模型升级先删提示和工具约束,只在重复失败时加回。他用可验证的长任务、动态工作流与例行维护说明,真正稳定的不是旧脚手架,而是任务边界、验收方式和迭代能力;也提醒系统工程与像素级 UI 仍未解决。 ★ 精讲二 | Kimi K3 上线即获 SGLang 推理与 Miles 训练支持03:14|来自 LMSYS Blog Kimi K3 的混合 KDA/MLA 架构迫使推理栈重做状态缓存、推测解码和并行策略。SGLang 与 Miles 给出的价值不只是首日兼容:ReplaySSM 用重放输入替代逐步状态快照,并把推理、预填充与 LoRA 强化学习串成可验证链路。性能数字均来自团队指定硬件和负载,不能直接外推。 ★ 精讲三 | 管理 AI 变化速度的进化架构模式05:53|来自 InfoQ 这篇架构文章把 AI 集成的高频变化集中到独立网关:模型路由、Agent 身份、动作策略、内容防护与审计可单独演进,后端业务系统保持稳定。它同时列出真实代价:延迟、集中化、运维负担和供应商新能力滞后;单团队、单模型场景未必值得引入这一层。 速览08:15 更多值得关注的内容 · DeepSWE:抗污染的代码智能体评测基准 [视频] — AI Engineer · Agent 开始「自我进化」:会出题、会反思,还会自己长出新技能 — 腾讯技术工程 · AI 如何正在扩展人们的工作内容 — OpenAI News · 蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash — 量子位 · 阿里最新发布,千问 AI 平台 Token Plan 实测来了! — Datawhale · NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式模拟 — Hugging Face - Blog · 百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践 — 大淘宝技术 补充阅读10:50 今天额外值得一读的几条 · 空间智能新作,影石开源户外全景重建算法 — 机器之心 · 顶会入选 | COVERT —— 面向视觉语言模型的隐私保护推理框架入选 ECCV 2026 — 字节跳动技术团队 · AI 最尴尬的短板,中国科学院出手了 — 量子位 · 下一代搜索智能体评测基准!美团开源 LoHoSearch,用知识图谱校准 AI 能力认知 — 美团 · 技术团队 · 本周 TOP 17 排名的 GitHub 开源项目大盘点,第一个值得收藏。 — 逛逛 GitHub 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-28 · Boris Cherny 谈如何打造 Claude Code:提示词消融、验证闭环与智能体工作流 [视频]:https://www.bestblogs.dev/video/227347908 · Kimi K3 上线即获 SGLang 推理与 Miles 训练支持:https://www.bestblogs.dev/article/732e62aab6 · 管理 AI 变化速度的进化架构模式:https://www.bestblogs.dev/article/f849ce23af · DeepSWE:抗污染的代码智能体评测基准 [视频]:https://www.bestblogs.dev/video/4a6cf8002 · Agent 开始「自我进化」:会出题、会反思,还会自己长出新技能:https://www.bestblogs.dev/article/5d978f2ae1 · AI 如何正在扩展人们的工作内容:https://www.bestblogs.dev/article/d568cbc6cd · 蚂蚁百灵发布新一代原生混合推理模型 Ling-3.0-Flash:https://www.bestblogs.dev/article/8245193e10 · 阿里最新发布,千问 AI 平台 Token Plan 实测来了!:https://www.bestblogs.dev/article/5d9d71bc12 · NVIDIA Cosmos-H-Dreams:为手术机器人带来实时生成式模拟:https://www.bestblogs.dev/article/ea561a40ef · 百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践:https://www.bestblogs.dev/article/46e8fa9511 · 空间智能新作,影石开源户外全景重建算法:https://www.bestblogs.dev/article/e18a7864a3 · 顶会入选 | COVERT —— 面向视觉语言模型的隐私保护推理框架入选 ECCV 2026:https://www.bestblogs.dev/article/987d47577c · AI 最尴尬的短板,中国科学院出手了:https://www.bestblogs.dev/article/a55988fb5f · 下一代搜索智能体评测基准!美团开源 LoHoSearch,用知识图谱校准 AI 能力认知:https://www.bestblogs.dev/article/f66d2fee8f · 本周 TOP 17 排名的 GitHub 开源项目大盘点,第一个值得收藏。:https://www.bestblogs.dev/article/7038b05879 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP131 · Claude Code 消融、Kimi K3 部署、AI 网关 · 07-28 早报
  7. 5d ago

    EP130 · NVIDIA 创始人心法、前沿模型产品化、LLM 评测 · 07-27 早报

    章节时间戳00:00 开场 00:41 精讲:黄仁勋复盘英伟达转型与创始人判断 03:19 精讲:Diane Penn 讲前沿模型如何变成产品 06:14 精讲:大模型裁判的用法、偏差与人工校准 08:51 速览:合成数据、Agent 小模型、具身机器人、Ruff、脑机接口 11:40 补充阅读:心理健康评测、向量搜索、实时视频、微软模型、模型卡 13:03 结语 ★ 精讲一 | Jensen Huang:打造 NVIDIA 的创始人心法 [视频]00:41|来自 Y Combinator 黄仁勋从买回 OpenGL 教科书纠正错误路线、向 Sega 坦白无法交付,讲到把 AlexNet 视为通用函数逼近器后重做整套计算栈。访谈把 NVIDIA 的转型拆成一套可复用的方法:深入算法域、坚持第一性原理,并让组织围绕创始人的长处演化。 ★ 精讲二 | Anthropic 的 Diane Penn:如何把前沿模型做成产品 [视频]03:19|来自 Lenny's Podcast Diane Penn 用 Golden Gate Claude、Claude Code 与模型发布复盘 Anthropic 如何把研究能力变成产品。她把高强度模型使用视为发现未来工作流的实验输入,并解释 eval 如何承接用户反馈、成为研究与产品协作的可测试接口,同时正视能力进步并不均匀的锯齿边界。 ★ 精讲三 | 究竟什么是 LLM-as-a-Judge?2026 年前沿技术实战指南06:14|来自 Hacker News - Newest: 「LLM」 这份指南从 pointwise、pairwise 与 rubric 三类判分方式出发,梳理 LLM-as-a-Judge 在模型评测、对齐与生产工程中的实际用法,也逐层拆开位置、冗长、自偏好、格式和对抗攻击等失真来源。它给出的落点很务实:拆分标准、交换顺序、参考答案校验,并始终用人工金标集持续标定。 速览08:51 更多值得关注的内容 · 规模化训练的真实难题:合成数据与预训练的工程现实 [视频] — AI Engineer · AI 拿走了 98%的工作,那属于你的、谁都替不了的 2%到底是什么? — 非凡产研 · Nanbeige4.2-3B:探索通用 Agent 小模型 — 魔搭 ModelScope 社区 · 腾讯开源三大具身基座模型,首席科学家张正友详解「三层脑」如何破解机器人反应慢 — InfoQ 中文 · 3 万小时触觉数据补齐具身智能「手感」!新智具身&复旦报告三连发 — 量子位 · Ruff v0.16.0:默认启用规则从 59 条增至 413 条 — Simon Willison's Weblog · Meta 开源 Brain2Qwerty v2:非侵入式脑机接口语句解码准确率达到 61% — InfoQ 中文 补充阅读11:40 今天额外值得一读的几条 · 用评估驱动开发打造心理健康 AI 教练 [视频] — AI Engineer · 当 RAM 成本过高时如何优化向量搜索:磁盘 vs 内存 ANN 索引 — Towards Data Science · 快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频 — 十字路口 Crossing · 微软发布全新自研 AI 模型,自称成本较 OpenAI 降低高达 89% — VentureBeat · 字节发了一张「永远最新」的模型卡片,我拿三个真实任务帮你测了测 — 王吉伟 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-27 · Jensen Huang:打造 NVIDIA 的创始人心法 [视频]:https://www.bestblogs.dev/video/cea291fb0 · Anthropic 的 Diane Penn:如何把前沿模型做成产品 [视频]:https://www.bestblogs.dev/video/085fbfbd6 · 究竟什么是 LLM-as-a-Judge?2026 年前沿技术实战指南:https://www.bestblogs.dev/article/20cb8c9352 · 规模化训练的真实难题:合成数据与预训练的工程现实 [视频]:https://www.bestblogs.dev/video/70c245059 · AI 拿走了 98%的工作,那属于你的、谁都替不了的 2%到底是什么?:https://www.bestblogs.dev/article/ecb2009752 · Nanbeige4.2-3B:探索通用 Agent 小模型:https://www.bestblogs.dev/article/1873a6fa14 · 腾讯开源三大具身基座模型,首席科学家张正友详解「三层脑」如何破解机器人反应慢:https://www.bestblogs.dev/article/f834198ca4 · 3 万小时触觉数据补齐具身智能「手感」!新智具身&复旦报告三连发:https://www.bestblogs.dev/article/7aeb4a9ce0 · Ruff v0.16.0:默认启用规则从 59 条增至 413 条:https://www.bestblogs.dev/article/30d667cf26 · Meta 开源 Brain2Qwerty v2:非侵入式脑机接口语句解码准确率达到 61%:https://www.bestblogs.dev/article/cadf54b18b · 用评估驱动开发打造心理健康 AI 教练 [视频]:https://www.bestblogs.dev/video/a1850946b · 当 RAM 成本过高时如何优化向量搜索:磁盘 vs 内存 ANN 索引:https://www.bestblogs.dev/article/170fa7aa3d · 快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频:https://www.bestblogs.dev/article/61f0b01bb9 · 微软发布全新自研 AI 模型,自称成本较 OpenAI 降低高达 89%:https://www.bestblogs.dev/article/720ea24dc0 · 字节发了一张「永远最新」的模型卡片,我拿三个真实任务帮你测了测:https://www.bestblogs.dev/article/a5451f9ba2 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP130 · NVIDIA 创始人心法、前沿模型产品化、LLM 评测 · 07-27 早报
  8. 6d ago

    EP129 · 创业韧性、智能所有权、端侧微型模型 · 07-26 早报

    ★ 精讲一 | AI 时代,什么真正让一家创业公司更具韧性 [视频]来自 Y Combinator YC 合伙人的判断很直接:AI 让写软件更便宜后,纯软件本身更难成为长期壁垒,难销售、强监管与硬件物理约束反而更值得攻克。对创始人更实用的是三条动作:尽早上线、每两周复盘、亲自与客户交流;AI 可以补能力,却替代不了共同创业者的支持与真实关系。 ★ 精讲二 | 掌握你的智能:获得持久 AI 优势的关键来自 LangChain Blog LangChain 把企业的 AI 优势拆成三层:可替换的模型、掌控工作方式的 Agent harness,以及承载政策、工具、偏好和记忆的业务上下文。文章进一步把成本、质量、权限边界和可观测性纳入所有权,并说明如何用 traces、反馈与 evals 形成越用越好的改进闭环。 ★ 精讲三 | 为什么还要做大模型?Google AI Edge 谈微型语言模型与边缘机器人 [视频]来自 AI Engineer Google AI Edge 负责人 Cormac Brick 给出端侧模型的分工图:1B–4B 小模型承担通用推理,50M–500M 微型模型通过任务化微调完成低延迟动作。原文比较多类硬件的内存和吞吐,并给出合成数据微调、语音函数调用与离线听写案例,帮助判断何时该把 Agent 留在设备上。 速览更多值得关注的内容 · 加速进化程昊:具身模型要做,但「先烈」不能当 — 腾讯科技 · 将 Nunchaku 4-bit 扩散推理集成到 Diffusers — Hugging Face - Blog · 在 TPU 上运行 Ray,第二部分:Ray AI 库 — Google Developers Blog · ChatGPT 健康功能正式上线 — OpenAI News · 开盒网暴、诈骗刷单,Fable5 等 8 款模型操作真实手机「成功作案」! — 机器之心 · Uber Eats 如何构建可闭环自调优的多模态智能体评测系统 [视频] — AI Engineer · Project Pilot:AI 模型能操控无人机吗? — Anthropic Research 补充阅读今天额外值得一读的几条 · 大科技公司错过了什么:初创公司如何凭世界模型继续胜出 [视频] — Y Combinator · Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了 — Founder Park · 从智能体轨迹到可重复的智能体模拟 [视频] — AI Engineer · 如何评估 AI 视频垃圾内容:Character.ai 的 Maor Bril 谈视频生成质量 [视频] — AI Engineer · Vending-Bench:长程智能体评测 [视频] — AI Engineer 相关链接· 本期早报在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-26 · AI 时代,什么真正让一家创业公司更具韧性 [视频]:https://www.bestblogs.dev/video/a710c0be0 · 掌握你的智能:获得持久 AI 优势的关键:https://www.bestblogs.dev/article/503459bcaa · 为什么还要做大模型?Google AI Edge 谈微型语言模型与边缘机器人 [视频]:https://www.bestblogs.dev/video/9a8bcd2cb · 加速进化程昊:具身模型要做,但「先烈」不能当:https://www.bestblogs.dev/article/9b65828cab · 将 Nunchaku 4-bit 扩散推理集成到 Diffusers:https://www.bestblogs.dev/article/fe33d168d4 · 在 TPU 上运行 Ray,第二部分:Ray AI 库:https://www.bestblogs.dev/article/45cc7204ad · ChatGPT 健康功能正式上线:https://www.bestblogs.dev/article/e15f1f591c · 开盒网暴、诈骗刷单,Fable5 等 8 款模型操作真实手机「成功作案」!:https://www.bestblogs.dev/article/3eefb07293 · Uber Eats 如何构建可闭环自调优的多模态智能体评测系统 [视频]:https://www.bestblogs.dev/video/f78c672ad · Project Pilot:AI 模型能操控无人机吗?:https://www.bestblogs.dev/article/e490646730 · 大科技公司错过了什么:初创公司如何凭世界模型继续胜出 [视频]:https://www.bestblogs.dev/video/2aff64e7d · Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了:https://www.bestblogs.dev/article/1e1d9cdefc · 从智能体轨迹到可重复的智能体模拟 [视频]:https://www.bestblogs.dev/video/070123458 · 如何评估 AI 视频垃圾内容:Character.ai 的 Maor Bril 谈视频生成质量 [视频]:https://www.bestblogs.dev/video/39474a4c0 · Vending-Bench:长程智能体评测 [视频]:https://www.bestblogs.dev/video/bab358d8a 关于 BestBlogsBestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 前往小宇宙评论区与主播互动

    EP129 · 创业韧性、智能所有权、端侧微型模型 · 07-26 早报

About

BestBlogs 早报音频版,精选 AI、技术、产品、设计与商业科技领域值得关注的高质量内容,陪你每天从真正重要的信息开始。

You Might Also Like