EasyVibeCoding Podcast

EasyVibeCoding

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

  1. 1d ago

    Anthropic 讓 Claude 以自主流程設計蛋白質結合物,15 個標靶命中 14 個;Mythos Preview 單標靶命中率為 35.1%

    Anthropic 讓 Claude 以自主流程設計蛋白質結合物,15 個標靶命中 14 個;Mythos Preview 單標靶命中率為 35.1%。 實驗結果 Anthropic 與 Adaptyv Bio、Twist Bioscience 合作,由兩家機構獨立合成並測試 Claude 產出的蛋白質。技術報告指出,研究團隊共測試 1,320 個設計,其中 354 個確認能與 14 個標靶結合;Mythos Preview 在逐一處理單一標靶時,命中率為 35.1%,Opus 4.8 與 Mythos Preview 同時處理多個標靶時,命中率則分別為 22.6% 與 26.7%。 Claude 依不同設定達成 22% 至 35% 的結合成功率 (Hit rate),並在 15 個蛋白質靶點中的 14 個成功自主設計出蛋白質結合劑。 部分設計的結合強度也超越既有成果。以 E3 ligase 次單元 RBX1 為例,Claude 的 90 個設計中有 28 個成功結合;其中最強設計的解離常數(KD)為 3.9 nM,優於同一競賽獲勝設計重新合成後測得的 45 nM。Claude 也在六個標靶上產生 15 個含有至少 20% β-sheet 的結合物,顯示它不只生成常見的 α-helix 結構。技術報告另指出,測試的 233 個結合物中有 130 個也能與小鼠同源蛋白結合,具備跨物種研究的潛力。 自主工作流程 Claude 並非只提出候選序列,而是根據單一 protocol prompt 自主完成一整套設計流程。這個約 16,000 字的 prompt 沒有指定標靶上的結合位置、支架或序列,Claude 必須自行研究標靶、選擇表位、呼叫公開的蛋白質結構生成與序列設計工具,進行多輪 in silico 最佳化,再篩選並排序每個標靶的 30 個設計。 實驗設定讓 Claude 在 24~48 小時內執行任務,並提供 NVIDIA H100 GPU 計算資源、網路與研究資料,以及 Google Drive、Slack、Gmail 和 bioRxiv 的 connectors。研究人員在啟動後沒有提供科學、技術或操作指引,主要只負責核准存取要求、監控基礎架構,並將 Claude 最終交付的序列送交合成與測試。Claude 使用的設計與結構預測模型皆為 open source,包括 RFdiffusion3、BoltzGen、Genie 3、OpenFold3 與 Boltz-2 等。 影片畫面 輔助素材展示九個經實驗確認的 de novo protein binders 與其標靶 3D 結構;畫面顯示的 Kd 包括 TREM2 的 1.1 nM 與 4 nM、IL-7Rα 的 3.6 nM 與 550 nM,以及 Nipah G 的 53 nM、TrkA 的 540 nM、EGFR 的 1.7 µM、VEGF-A 的 1.6 µM 和 BHRF1 的 4.2 nM。畫面最後將結構排列成「ANTHROPIC」字樣;這些名稱與數值屬於影片中呈現的觀察資訊。 九個由 Claude 設計的實驗驗證 de novo protein binders 及其標靶的 3D 結構圖 由九個以蛋白質結構排列構成「ANTHROPIC」字樣的圖形所組成的視覺圖表,下方分別標示其標靶名稱(包含 Nipah G、TREM2、TrkA、IL-7Rα、EGFR、VEGF-A 與 BHRF1)以及對應的親和力解離常數數值($K_D$),底部並附有說明文字指出這些為經實驗證實的 de novo 蛋白質結合物。 研究邊界與安全性 Anthropic 特別強調,protein binder 不是藥物。設計出高親和力結合物只是藥物開發的第一步,後續仍須確認分子是否安全、有效,並完成多個階段的驗證。因此,這項成果代表的是早期藥物設計能力的進展,不是 Claude 已經完成藥物開發。 Anthropic 也承認,Claude 對部分標靶仍然失敗,例如 90 個 MBP 設計沒有一個獲得確認的結合結果;研究團隊表示,後續還要進行更完整的特性分析,以確認命中率與親和力測量。此外,能自主執行生物研究具有雙重用途,若缺乏穩健的安全措施,也可能被用於危險研究,因此 Claude Fable 5 的 protein design 與其他具雙重用途的研究生物能力,目前不對一般使用者開放。 後續開放計畫 Anthropic 表示,讓科學家使用最具能力模型的 access program 仍是最高優先事項之一,預計很快公布更多資訊;目前 Opus 5 仍是可用於生命科學研究、能力最強的模型。完整說明可參考 Anthropic 的研究文章與技術報告,Anthropic 也已公開本次使用的 prompts 與資料集(Hugging Face),供研究者重現流程並作為後續 benchmark。 原文:https://easyvibecoding.app/curated/3030-anthropic-claude-autonomous-protein-binder-design

  2. 1d ago

    Codex 為降低 GPT-5.6 可能誤刪使用者檔案的風險,加強多層防護

    Codex 為降低 GPT-5.6 可能誤刪使用者檔案的風險,加強多層防護。 團隊發現,極少數情況下,用來清理暫存工作的指令可能誤刪使用者檔案;這種風險不應發生。 問題成因 Codex 工作時會建立暫存資料夾並在完成後清理;少數情況下,GPT-5.6 重新使用系統環境變數 $HOME 存放暫存內容,導致格式錯誤的清理指令指向真正的家目錄。此外,模型曾在未確認暫存路徑現有內容的情況下,嘗試刪除或覆寫檔案。 防護措施 Codex 現在會先確認刪除目標、建立全新的暫存資料夾、避免挪用系統環境變數,並優先採取可復原的操作;若範圍不明,則停止執行。團隊也強化高風險刪除指令的執行檢查,遭拒時要求模型改用較安全的方法,並提高誤啟用 Full access 的難度、加入更清楚的警告及限制高風險權限組合,同時更新 Auto-review。 評估與建議 團隊以重現實際失敗案例的評估驗證修正,結果大幅降低相關行為,且未影響一般程式開發;後續還會加入聚焦此類風險的 reinforcement-learning 任務與 graders,並從訓練資料中篩除破壞性操作。Tibo 建議使用者保持 Codex app 更新,並選擇「Ask for approval」或「Approve for me」沙盒模式;只有在可信且能復原的環境中才使用 Full access。 原文:https://easyvibecoding.app/curated/3027-codex-gpt-5-6-reduces-user-file-deletion-risk

  3. 1d ago

    Cursor 將 Git 儲存系統 Cursor Origin 按資料庫設計以支援大規模工作負載

    Cursor 將 Git 儲存系統 Cursor Origin 按資料庫設計以支援大規模工作負載。 分享重點 Cursor 於 2026 年 8 月 19 日分享 Vicent Martí 前一天發布的文章〈Git at any scale〉,藉此交代 Origin 的設計脈絡。文章指出,Git 的分散式特性在伺服器端反而帶來挑戰:packfile 以壓縮與 delta 方式儲存物件,讀取時必須同時穿越 DAG 與磁碟資料配置,難以直接依靠網路檔案系統擴充。 既有架構限制 GitHub 早期曾嘗試 NFS、GFS 與 DRBD,後來改以遠端 RPC 存取專用檔案伺服器;約 2013 年形成的 Spokes 則在本機 NVMe 磁碟保存完整 Git repository,並以多副本與 3PC 維持一致性。這套方法能讓 fetch 與 clone 快速,也避免 eventual consistency 造成推送後讀不到 commit 的問題。 面向新工作負載 文章認為,Spokes 的 3PC 使每個步驟都受最慢節點限制:副本越多,push throughput 越差。2026 年企業 monorepo 需要更多副本承擔 CI 流量;另一方面,Agent 大量建立短命小型 repository,也讓每個 repository 固定維持三份副本變得浪費。Cursor 因此回顧這些取捨,並將 Origin 視為資料庫來設計與操作,以回應可靠性、效能與規模化需求。 淺綠色背景的網格幾何圖形,畫面左下角為起點,向右上延伸出數條對角虛線,並有多條縱橫實線交錯劃分出大小遞增的矩形區塊。 原文:https://easyvibecoding.app/curated/3034-cursor-designs-origin-database-for-large-scale-workloads

  4. 1d ago

    OpenAI 暫停最新模型 RL 訓練兩週,強化監控與安全防護

    OpenAI 暫停最新模型 RL 訓練兩週,強化監控與安全防護。 核心決策 OpenAI 於 2026 年 8 月 19 日表示,隨著模型能力提升,內部開發與測試的風險也同步增加,因此暫停面向部署的最新模型 RL 訓練兩週,期間強化研究環境、進行 red team 測試,並擴大監控範圍。規模最大的預定 frontier RL run 仍未恢復,OpenAI 會先透過較小規模的訓練與評估確認防護措施有效,並累積更多 alignment 證據。 新增防護 OpenAI 表示,已針對高風險訓練、評估與 tool-using inference 採取三類措施: 強化 workload isolation,要求執行模型產生或其他不受信任程式碼的工作負載使用更嚴格的沙盒,也涵蓋可能因處理模型輸出而遭入侵的軟體。 加強 network isolation,限制高風險工作負載連線到網路或內部網路,避免單一工作負載或支援服務遭入侵後直接取得未授權存取權。 持續進行 security testing,移除可能存在漏洞的共用服務、降低長駐權限、改善安全與信任邊界,並以模型自動化模擬攻擊,持續測試這些邊界。 目前涉及 Astra 或 cyber models 的工作負載必須採用最高等級的安全防護;OpenAI 認定 Astra models 可能具備 critical level 的 cyber capability,因此部分訓練與評估仍須完成環境遷移和強化後才能恢復。 多階段監控 新的監控架構會在每個取樣 token 檢查模型內部活動,先由 activation classifiers 偵測可疑訊號,再逐級交由更複雜、需要更多運算資源的自動化調查系統分析。系統會檢視 tool actions、可取得的 reasoning,以及完整活動序列,尋找未授權存取、資料竊取、破壞行為和試圖繞過防護的行為。 OpenAI 的目標是在監控發現可疑活動後 30 分鐘內發出警示。若疑似違反 critical security boundary,安全、保全與研究團隊會收到最高優先級通知;若團隊無法在 30 分鐘內確認是誤判,預期就要暫停相關活動。這套監控適用於 Sol level 或更高模型涉及工具的所有 RL 訓練與評估;自 2026 年 8 月 7 日判定 Astra 可能具備 critical cyber capabilities 後,也擴大到 Astra 使用工具的所有 inference。監控成本目前約占受監控 inference compute 的 20%,但不同訓練和評估工作負載的實際開銷差異很大。 alignment 與後續方向 OpenAI 將在更完整的訓練階段套用 alignment 方法,包括改善 reward models、訓練模型更誠實地說明行動與限制,以及降低利用 rewards、graders、tools 或 oversight 弱點的行為;同時擴大評估外部系統與資源互動時可能造成傷害的情境。 OpenAI 說明,這次調整與 OpenAI-Hugging Face incident,以及 Astra 可能達到 Preparedness Framework 中 Critical cybersecurity capability threshold 的初步證據有關。公司計畫更新 Preparedness Framework,讓監控、alignment 與安全措施貫穿訓練到部署,並在未來幾週公布相關技術報告與更多研究結果。 原文:https://easyvibecoding.app/curated/3023-openai-pauses-model-rl-training-safety-monitoring

  5. 1d ago

    Vercel Labs 開源 fx:Zig 原生 coding agent 冷啟動僅 10µs

    Vercel Labs 開源 fx:Zig 原生 coding agent 冷啟動僅 10µs。 fx 目前仍屬實驗性工具,功能與介面可能頻繁變動。 核心設計 fx 以 Fast、Light、Open 三項原則為基礎:單一原生執行檔不需安裝 runtime,冷啟動時間為 10µs,且在接受輸入前不做多餘的工作或 I/O;執行檔大小為 6.3MiB,基線記憶體使用量維持在個位數 MiB,適合資源受限環境與 Agent 沙盒。它採用 Apache-2.0 授權,不綁定特定 model 或 provider,可搭配本機或雲端推論,並透過 skills、plugins 與 MCP 擴充。 純黑色背景中央帶有白色 fx 字母標誌,左上方有一白色小三角形。 harness 與使用方式 fx 將極簡主義延伸到 system prompt、工具、功能與執行檔本身,目標是降低 context 用量與取得第一個 token 的等待時間,方便進行 model benchmark、沙盒隔離、evals 與 gyms。使用者可以直接操作 CLI,也能把 fx 嵌入其他系統。終端體驗更接近 Unix shell,而不是 IDE:保留捲動歷史、僅輸出必要內容,並極少使用複雜的 TUI。程式化整合則提供 fx ask --json 結構化輸出與 fx acp,可連接編輯器及其他客戶端;WebAssembly 也能在瀏覽器內執行完整 fx,官方展示頁為 fx.sh/try。 隱私與部署 隱私被列為設計限制:fx 不蒐集產品遙測資料,session 與使用量留在本機;除了推論服務外,不會將原始程式碼或 prompt 傳送至其他端點。若搭配本機推論並關閉自動更新,官方稱 fx 可做到完全 hermetic。 安裝與風險 來源提供以下安裝方式: `bash curl -fsSL https://fx.sh/setup.sh | bash ` 這是將遠端內容直接交由 bash 執行的高風險來源指令,必須先人工檢查 URL、下載內容與執行權限,不應視為可安心直接執行。媒體畫面顯示安裝後為 fx 0.0.1,執行 fx 會進入 fx v0.0.1 介面,並以 auto - glm-5.2 回應 hello world;這些版號與互動結果屬畫面觀察,不等同於原文公布的正式規格。官方專案頁為 fx.sh,並提醒使用者須自行承擔實驗性工具的使用風險。 終端機介面中安裝並執行 fx 工具的互動畫面 終端機介面中安裝並執行 fx 工具的互動畫面 影片中的 Prompt 與操作: Prompt(00:06): hello world 操作步驟: 1. (00:01)於終端機輸入安裝指令 `curl -fsSL https://fx.sh/setup.sh | bash` 2. (00:04)輸入 `fx` 啟動工具 3. (00:06)在 fx 介面中輸入 `hello world` 原文:https://easyvibecoding.app/curated/3029-vercel-labs-open-sources-zig-coding-agent-fx

  6. 1d ago

    Z AI 發布 GLM-5.3:Artificial Analysis 評 60 分,權重釋出後將並列開放權重模型最高分

    Z AI 發布 GLM-5.3:Artificial Analysis 評 60 分,權重釋出後將並列開放權重模型最高分。 這次更新最大的進步在 Agentic 能力與實際知識準確度,但 token 使用量與部署成本也同步上升。 模型定位 2026 年 8 月 19 日,Z AI 發布 GLM-5.3,目前可透過 Z AI 的 first-party API 使用,團隊表示預計在一週內釋出權重。Artificial Analysis 指出,GLM-5.3 的總參數量仍為 753B,MoE 架構下的 active parameters 為 40B,與 GLM-5.2 相同;模型具備 1M token 的 context window,採 MIT 授權。若權重如期公開,GLM-5.3 與 Kimi K3 將代表開放權重模型與 proprietary frontier 之間的差距進一步縮小。 GLM-5.3 在 Artificial Analysis Intelligence Index 取得 60 分,與 Kimi K3 持平,並較前代 GLM-5.2 提升 7 分。 Agentic 能力 GLM-5.3 在 GDPval-AA v2——用於評估真實世界 Agentic 知識工作的測試——取得最明顯的提升: Elo 從 GLM-5.2 的 1524 上升至 1770,成長 246 分。 在所有受測模型中排名第二;同系列貼文文字將 Claude Opus 5 記為 1855,圖表則顯示 1845。 它超越先前開放權重領先者 Kimi K3 的 1668,差距超過 100 分。 Artificial Analysis 因此認為,GLM-5.3 的 Agentic 表現已進入 frontier models 的行列,而不只是一般問答能力改善。 圖表顯示 GLM-5.3 為 1769 分、Claude Opus 5 為 1845 分;同系列貼文文字則分別記為 1770 與 1855,兩組各相差 1 分與 10 分。 效率與成本 GLM-5.3 的能力提升伴隨較低的 token 效率。Artificial Analysis Intelligence Index v4.1 顯示,它每項任務約使用 18,700 個輸出 token,高於 GLM-5.2 的 15,700 個,亦比 Kimi K3 的 14,700 個多 27%。這使 GLM-5.3 每項 Intelligence Index 任務的成本為 0.68 美元,是 GLM-5.2 0.44 美元的 1.5 倍;不過在相同智能層級中仍較便宜: 比 Kimi K3 的 0.84 美元低 19%。 比 GPT-5.6 Sol 的 1.23 美元低 45%。 因此,GLM-5.3 的部署成本上升,部分原因是 token 使用量成長約 20%,但整體單項任務價格仍保有競爭力。 GLM-5.3 在 GDPval-AA v2 分項取得 63%,為圖中開放權重模型最高;高於 Kimi K3 的 59% 與 GLM-5.2 的 48%。 知識準確度 在 AA-Omniscience 測試中,GLM-5.3 從 GLM-5.2 的 4 分提升至 14 分,成為僅次於 Kimi K3(20 分)的第二佳開放權重模型。這項進步不只是更常拒答所造成:準確率由 24% 提升至 34%,嘗試回答的比例也從 46% 上升至 55%。不過,幻覺率同時由 26% 小幅回升至 30%;Artificial Analysis 的另一則貼文則將原始準確率記為 23%,但同樣報告提升至 34%,顯示摘要資料中的起始數字存在一個百分點差異。 GLM-5.3 在 AA-Omniscience Index 取得 14 分,相較於 GLM-5.2 的 4 分有所提升。 API 與定價 GLM-5.3 的標準價格如下,快取輸入 token 另有折扣: 輸入:每 1M token 收費 1.40 美元。 輸出:每 1M token 收費 4.40 美元。 快取輸入:套用 81% 的 cache hit 折扣後,每 1M token 收費 0.26 美元。 完整分析可參考 Artificial Analysis 的 GLM-5.3 模型頁面,整體評測資訊則見 Artificial Analysis。 原文:https://easyvibecoding.app/curated/3024-z-ai-releases-glm-5-3-highest-scoring-open-model

About

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

You Might Also Like