脈報

思思主播

脈報

  1. 9h ago

    AI 兩週搬完百萬行 code,Anthropic 的秘訣是不修 code

    Anthropic 官方公開用 Claude Code 兩週遷移百萬行 code 的方法論:不修 code,修產出 code 的迴圈。先建裁判再開工,成本約 16.5 萬美元,批次 AI 工作都能借用。 ⭐ 文章深度讀:Bun 案例實際燒掉的 token 用量帳,和 Zig 作者對這次改寫的批評,影片沒展開,文章裡有完整數字與連結 → https://heymaibao.com/anthropic-million-line-code-migration/ ⚡ 章節重點 開場 00:00 第一個實例 Bun 兩週搬完百萬行 00:58 第二個實例 一個週末 16 萬行 02:15 你該修的是迴圈 03:26 先建裁判再開工 04:33 方法論的三個重點 05:22 錢的部分 06:19 我的判斷 06:51 帶得走的心法 07:18 📝 懶人包 ∙ Anthropic 官方公開內部用 Claude Code 做大規模程式碼遷移的方法論:熱門 JavaScript 工具 Bun 從 Zig 換到 Rust (兩種程式語言),兩週產出百萬行 code,合併前 100% 通過既有測試,2026 年 6 月已正式出貨 ∙ 遷移經濟學翻轉:過去百萬行等級的遷移要 4 年、300 到 400 萬美元的工程資源,Bun 這次的 API 用量定價約 16.5 萬美元 ∙ 核心方法是人不修個別錯誤:審查 AI 重複抓到同一類問題,就往規則手冊 (rulebook) 加一條規則,然後整批重新生成,人的注意力只放在 pattern 上 ∙ 我的觀察:這套「修迴圈不修產出」的心法完全可以搬出工程圈,批次翻譯、大量改寫、資料整理都適用,但成立條件是你得先有一個抓得到錯的機械裁判,這一步多數人都跳過了 📚 參考資料 How Anthropic runs large-scale code migrations with Claude Code (X) → https://x.com/ClaudeDevs/status/2079654423828304282 How Anthropic runs large-scale code migrations with Claude Code (官方 blog) → https://claude.com/blog/ai-code-migration Rewriting Bun in Rust → https://bun.com/blog/bun-in-rust anthropics/code-migration-kit-with-claude-code → https://github.com/anthropics/code-migration-kit-with-claude-code Zig creator calls Bun's Claude Rust rewrite "unreviewed slop" → https://www.devclass.com/ai-ml/2026/07/15/zig-creator-calls-buns-claude-rust-rewrite-unreviewed-slop/5271749

  2. 6d ago

    Cursor 實測:讓貴模型只負責規劃,AI 帳單少掉近九成

    Cursor 實測:同一個任務、同樣通過全部測試,帳單從 10,565 美元掉到 1,339 美元。省錢的關鍵是讓貴模型只負責規劃,把執行交給便宜模型,指令一旦明確照做就行。 ⭐ 文章深度讀:五種失效模式的完整修法、舊版崩壞的逐項數據,還有 Field Guide 的做法 → https://heymaibao.com/cursor-agent-swarm-model-economics/ ⚡ 章節重點 開場 00:00 實驗長什麼樣 00:25 四種模型組合 01:22 帳單差在哪 02:23 便宜的規劃者不等於便宜的整體 03:35 為什麼拆成想和做會有效 04:22 五種失效模式 05:28 失控長什麼樣 06:30 我會怎麼用這篇 07:19 📝 懶人包 ∙ 在新版系統下,四種模型組合最終都通過 100% 測試套件,但總花費從 1,339 美元 (Opus 4.8 規劃、Composer 2.5 執行) 到 10,565 美元 (GPT-5.5 從頭包到尾) 不等 ∙ 執行端扛下至少 69% 的 token (模型的計價單位,用量直接等於帳單),多數情況超過 90%。但在 Opus 4.8 那組裡,規劃端那一小撮 token 吃掉了約三分之二的錢 ∙ 省錢的關鍵不在挑便宜的模型。Fable 5 當規劃者的帳單比 Opus 4.8 低,卻讓執行端多燒好幾倍 token,整輪算下來反而更貴 ∙ 我的觀察是,這篇真正能帶走的東西是一條分工原則:貴模型負責收斂模糊,便宜模型負責執行明確指令。它不需要你有上千個 agent 才成立,手上有兩三個並行任務時就開始值錢 📚 參考資料 Agent swarms and the new model economics → https://cursor.com/zh-Hant/blog/agent-swarm-model-economics Agent swarms and the new model economics (英文原版) → https://cursor.com/blog/agent-swarm-model-economics cursor/minisqlite → https://github.com/cursor/minisqlite sqllogictest → https://sqlite.org/sqllogictest Scaling long-running autonomous coding → https://cursor.com/blog/scaling-agents

  3. Jul 27

    OpenAI 把「不要停」寫進 Codex:/goal 如何改變長任務

    Codex CLI 0.128.0 的 /goal 能保存目標、跨回合自動續跑,並要求 Agent 以實際證據稽核完成。本文從官方原始碼、release 與實測拆解適用任務、安全煞車和成功標準。 ⭐ 文章深度讀:能長跑還不夠,真正難的是把完成定義寫成可驗證的證據 → https://heymaibao.com/codex-goal-long-running-tasks/ ⚡ 章節重點 開場:/goal 適合什麼任務 00:00 Codex 如何讓 goal 跨回合存活 00:44 目標狀態與自動續跑 01:25 完成稽核怎麼證明真的做完 01:50 長跑 Agent 的安全煞車 02:39 回饋環境決定證據品質 03:01 怎麼寫可驗證的 goal 03:27 探索型任務的現實代價 03:50 權限與隔離邊界 04:16 完成定義才是稀缺能力 04:41 📝 懶人包 ∙ Codex CLI 0.128.0 一次補上 goal 的持久化、app-server API、model tools、自動續跑與終端控制 ∙ active goal 在 thread 閒置後會自動建立下一個 turn,讓同一個目標跨回合繼續 ∙ 每輪續跑都要求 agent 對照實際 artifacts 與成功條件做完成稽核,單靠測試綠燈或 manifest 完整還不夠 ∙ 我的觀察是,/goal 最適合解法未知、終點可驗證的任務,缺少真實回饋時,跑得再久也只會放大猜測 📚 參考資料 Felipe Coury:Codex CLI 0.128.0 的 /goal 定位 → https://x.com/fcoury/status/2049917871799636201 Ray Amjad:The Codex Feature That's Going Viral Right Now → https://www.youtube.com/watch?v=p88mkfPkOZc OpenAI Codex 官方 repository → https://github.com/openai/codex Codex CLI 0.128.0 官方 release → https://github.com/openai/codex/releases/tag/rust-v0.128.0 OpenAI Developers:Follow a goal → https://developers.openai.com/codex/use-cases/follow-goals/

  4. Jul 26

    OpenAI Codex 寵物看似玩具,9 個動作全對應 agent 狀態

    OpenAI Codex 桌面寵物用 /pet 喚醒、/hatch 自訂。官方 hatch-pet 規格顯示 9 個動畫狀態全對應 app 執行狀態,等你批准時會擺出期待姿勢,做砸了就垮下來給你看。 ⭐ 文章深度讀:影片講的是這 9 個動作怎麼對應 agent 狀態,文章版多了每一格的毫秒表、禁用效果清單的完整條目,還有鏡射那三道門的原文限制 → https://heymaibao.com/openai-codex-pets-agent-states/ ⚡ 章節重點 開場 00:00 先講它是什麼 00:25 內部人自己先擋了一句 01:18 9 個動作,就是 Codex app 的 9 種狀態 01:46 規格嚴到什麼程度 03:33 真正值得抄的三件事 05:34 想自己孵一隻的話,現況有點尷尬 06:57 我的判斷 07:55 📝 懶人包 ∙ Pets 是 Codex app 的可選動畫夥伴,在「設定 > Pets」開啟,用 /pet 喚醒、/hatch 自訂,以浮動疊層的形式浮在畫面上 ∙ OpenAI 官方的 hatch-pet 技能文件定義了一套死規格:8 欄 9 列、每格 192×208 像素的固定拼版圖,9 列直接對應 Codex app 的 9 個狀態,連每一格要停留幾毫秒都寫死 ∙ 整條產製流程把圖像模型和確定性腳本切開,圖像模型只負責畫,幾何對齊與驗證交給 Python 腳本,而且機械驗證通過了還要再用眼睛看一遍才算過 ∙ 我的觀察是,這份規格書的價值高過寵物本身,但成立條件很明確:你手上要真的有一條需要驗收 AI 生成素材的流程,否則它就只是一份寫得很好的文件 📚 參考資料 Codex app settings:Pets → https://developers.openai.com/codex/app/settings Tibo (@thsottiaux) 的使用心得 → https://x.com/thsottiaux/status/2050280111820406795 openai/skills 的 hatch-pet skill 目錄 → https://github.com/openai/skills/tree/main/skills/.curated/hatch-pet OpenAI Developers 的 /hatch 公告 → https://x.com/openaidevs/status/2050275779452588309 Pets 官方說明文件 → https://learn.chatgpt.com/codex/pets hatch-pet SKILL.md 原始檔 → https://github.com/openai/skills/blob/main/skills/.curated/hatch-pet/SKILL.md openai/plugins:接班 repository → https://github.com/openai/plugins Codex 官方 skills 文件 → https://developers.openai.com/codex/skills 9to5Mac:Codex Pets 發佈當日實測 → https://9to5mac.com/2026/05/01/i-think-i-just-vibe-coded-lil-finder-guy-onto-my-mac/ Agent Skills 格式規格 → https://agentskills.io/specification

  5. Jul 23

    GPT-5.6 誤刪整個家目錄:要三個開關同時關掉才會發生

    整個家目錄被 GPT-5.6 刪掉:貼文列出的觸發組合是 full access 開啟、沒有 sandbox、auto review 也沒開。這篇說明失誤如何從 $HOME 覆寫發生,以及你該檢查哪三個開關。 ⭐ 文章深度讀:三個開關的完整檢查清單,加上 $HOME 覆寫怎麼變成刪掉家目錄的機制拆解 → https://heymaibao.com/gpt-5-6-home-directory-deletion/ ⚡ 章節重點 開場 00:00 這件事到底發生了什麼 00:51 三個開關,缺一個就不會出事 01:15 錯誤發生在環境變數,不在意圖 03:18 他們的回應方式值得記一筆 04:33 你現在可以做的檢查 05:58 📝 懶人包 ∙ Tibo (@thsottiaux) 在 X 上以第一人稱「我們」代表一個調查團隊說明,他們已經查了數起 GPT-5.6 非預期刪除檔案的回報 ∙ 最常見的觸發組合是三個條件同時成立:full access 模式開啟、執行時沒有 sandbox 保護、auto review 也沒有啟用 ∙ 失效點在環境變數這一層,模型想覆寫 $HOME 來指定一個暫存目錄,弄錯之後,刪除動作打在真正的家目錄上 ∙ 我的觀察是,這件事的教育價值在條件組合。三個開關的關係是「而且」,不是「或者」,這決定了你該檢查什麼 📚 參考資料 On file deletions - Tibo (@thsottiaux) → https://x.com/thsottiaux/status/2077630111499882637 Codex Permission modes → https://learn.chatgpt.com/docs/permission-modes Codex Auto-review → https://learn.chatgpt.com/docs/sandboxing/auto-review GPT-5.6 System Card → https://deploymentsafety.openai.com/gpt-5-6 OpenAI's new flagship model deletes files on its own, people keep warning → https://techcrunch.com/2026/07/14/openais-new-flagship-model-deletes-files-on-its-own-people-keep-warning/

  6. Jul 20

    Kimi K3 每 token 便宜一半,實際帳單卻和 GPT-5.6 打平

    2.8 兆參數的 Kimi K3 能力擠進第一梯隊,價格也是。它每 token 便宜一半但用掉兩倍,總帳單和 GPT-5.6 Sol 打平。原因是它只有 max 一個思考檔位,完全沒有省的餘地。 ⭐ 文章深度讀:7 月 27 日的開放權重會不會準時釋出 → https://heymaibao.com/kimi-k3-cost-reality-check/ ⚡ 章節重點 開場 00:00 K3 是什麼 00:36 公告裡沒有出現的那個字 01:09 價格才是這次真正的新聞 01:22 Theo 的算法:單價砍半,帳單打平 02:05 評測數字對得上 03:08 兩個數字只差一毛,這叫打平 03:21 因為它只有一個檔位 03:37 鵜鶘實測:八成輸出花在想 04:04 能力上它擠進了第一梯隊 05:04 兩個 token 數字,比較對象不同 05:33 那個鵜鶘測試被作者除役了 06:02 開放權重還是一張期票 06:23 我的觀察:要比就比每個任務 06:33 📝 懶人包 ∙ Moonshot 發佈 Kimi K3,官方主打 2.8 兆參數、100 萬 token context 與原生多模態,定位在 agentic coding,也就是讓模型自己來回呼叫工具、跑完整段開發任務的用法。開放權重承諾在 2026 年 7 月 27 日前釋出,公告當下還沒發生 ∙ K3 的 API 定價是每百萬 token 輸入 3 美元、輸出 15 美元,和 Anthropic 的 Claude Sonnet 系列同一級,是中國 AI 實驗室至今發佈過最貴的模型。更早的 Kimi K2.6 只要 0.95 美元 / 4 美元 ∙ t3.gg 的 Theo 依日常使用估算,多數任務下 K3 的總成本和 GPT-5.6 Sol 差不多,因為單價便宜一半的優勢被兩倍的 token 用量吃掉了。另一邊,評測機構 Artificial Analysis 跑出的每任務成本是 K3 的 0.94 美元對 GPT-5.6 Sol 的 1.04 美元 ∙ 我的觀察是,「每百萬 token 多少錢」是評估 AI 模型時最容易誤導人的一張表。它假設所有模型解同一個任務會用掉差不多的 token,而這個假設在會先「想」一輪再回答的推理模型普及之後就已經失效了。要比就比每個任務的實際支出 📚 參考資料 Introducing Kimi K3: Open Frontier Intelligence → https://x.com/Kimi_Moonshot/status/2077830229968683203 Kimi K3, and what we can still learn from the pelican benchmark → https://simonwillison.net/2026/Jul/16/kimi-k3/ Theo 對 Kimi K3 實際成本的判斷 → https://x.com/theo/status/2078215659948052984 Kimi K3 Tech Blog: Open Frontier Intelligence → https://www.kimi.com/blog/kimi-k3 Flagship Model Kimi K3 Pricing → https://platform.kimi.ai/docs/pricing/chat-k3 Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index → https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5

  7. Jul 20

    他不換工具,把 Hermes 的記憶系統重建在 Claude Code 裡

    記憶系統可以拆成三個問題:怎麼存、開新對話載入什麼、問三個月前的事找不找得到。有人用這三個問題,決定不換工具,直接把 Hermes 的記憶重建在 Claude Code 裡。 ⭐ 文章深度讀:影片講的是三個問題怎麼拆,文章多寫了我保留的部分與可查證邊界 → https://heymaibao.com/rebuild-hermes-memory-in-claude-code/ ⚡ 章節重點 開場 00:00 大家離開的理由 00:28 拆記憶系統的三個問題 01:55 前兩格兩邊幾乎打平 03:12 真正的差距在第三格 04:29 最容易被跳過的一步 05:53 為什麼不換工具 06:21 我保留的部分 07:16 你今天可以做的 07:54 📝 懶人包 ∙ Kilo 的留言分析指出,大家換到 Hermes agent 的第一名理由是記憶,不是整合數量,也不是自建技能 (影片轉述,未出示可查證出處) ∙ 任何記憶系統都可以拆成三個問題:重要的事怎麼存、開新對話時自動載入什麼、問一件三個月前的事怎麼找回來 ∙ 前兩個問題兩邊做法幾乎一樣,真正的差距全部落在第三個 ∙ 我的觀察是,這整套主張目前沒有附上任何量測,沒有檢索準確率、沒有成本數字、也沒有失敗案例 📚 參考資料 I Rebuilt Hermes's Best Feature in Claude Code (Steal This) → https://www.youtube.com/watch?v=9CiOwbmOKdU NousResearch/hermes-agent → https://github.com/NousResearch/hermes-agent Hermes Agent Sessions 文件 → https://hermes-agent.nousresearch.com/docs/user-guide/sessions Claude Code 記憶機制官方文件 → https://code.claude.com/docs/en/memory Claude Code 資料使用說明 → https://code.claude.com/docs/en/data-usage garrytan/gbrain → https://github.com/garrytan/gbrain

  8. Jul 20

    GPT-5.6 額度爆炸的真正原因:Ultra 根本不是推理等級

    Codex 的 Ultra 被放在推理強度滑桿上,但 OpenAI 官方文件寫的是它預設協調四個代理平行跑。這篇拆解 GPT-5.6 額度爆炸的三個放大器,以及四個可以立刻執行的調整。 ⭐ 文章深度讀:文章多了一段把模型固定住只換工具的對照實驗,以及它踩到服務條款的那一面 → https://heymaibao.com/gpt-5-6-ultra-usage-burn/ ⚡ 章節重點 開場 00:00 Ultra 到底做了什麼 01:01 放大器一 併發加最高強度 02:27 放大器二 子任務繼承不了較低設定 02:40 放大器三 系統提示詞 03:37 可以立刻做的四件事 04:10 有沒有終點才是真正的差別 05:44 更正節目的一處說法 06:43 我的判斷 07:41 📝 懶人包 ∙ 在 OpenAI 官方文件裡,Ultra 做的事是預設協調四個代理平行跑,Max 才是給單一代理更多推理時間。這是兩個不同維度的東西 ∙ 節目的說法是,Codex 目前的子任務實作不讓上層指定要用哪個模型與多高的強度,所以開著 Ultra 派工時,整棵樹都跟著跑在最高設定 ∙ 同樣據節目查證,Codex 的系統提示詞 (system prompt) 裡有大量前端設計規範,不分任務類型都會載入,寫 Rust 這種跟網頁無關的程式語言也會吃到 ∙ 我的觀察是,這件事最重要的訊號藏在它被發現的過程裡。一個使用者要花好幾天翻自己的紀錄,才能拼出「我的錢花到哪裡去了」,這種資訊本來應該由工具方提供 📚 參考資料 We're back to "too many models" (Nerd Snipe) → https://www.youtube.com/watch?v=bjW7nL3l08g GPT-5.6: Frontier intelligence that scales with your ambition → https://openai.com/index/gpt-5-6/ Codex 模型與 reasoning effort 說明 → https://developers.openai.com/codex/models Orchestrate subagents at scale with dynamic workflows → https://code.claude.com/docs/en/workflows Claude Code 法遵與合規說明 → https://code.claude.com/docs/en/legal-and-compliance openai/codex 開源儲存庫 → https://github.com/openai/codex

About

脈報

You Might Also Like