EasyVibeCoding Podcast

EasyVibeCoding

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

  1. 1 day ago

    xAI 發布 Imagine Image 2.0,影像生圖與編輯 Arena 均排名全球第 2

    xAI 發布 Imagine Image 2.0,影像生圖與編輯 Arena 均排名全球第 2。 Grok 表示,這款新模型不只適合生成圖片,也能處理資訊圖表、廣告、遊戲 asset、UI/UX mockup 與分鏡圖等工作。 發布與可用性 Imagine Image 2.0 於 2026 年 8 月 8 日由 Grok 公布,現已在 grok.com/imagine 以新的 Quality Mode 提供使用,並支援 iOS 與 Android 應用程式。官方將它定位為「能用於實際工作的影像模型」,強調模型會更貼近 prompt 的細節,改善排版與文字呈現,也提高生成結果的事實性與實用性。API 目前尚未開放;Grok 表示 API access coming soon,Arena 也確認目前只能在應用程式中使用。 來源:@grok(回覆)|Grok Imagine Image 2.0 發表宣傳與圖像生成範例 精準編輯工具 新版本把局部修改作為核心能力,讓使用者只改動指定區域,盡量保留畫面的其他內容: Magic Wand 只修改使用者指向的區域,例如改變提袋的材質或風格。 Segmentation 可選取影像中的精確範圍,替換家具、物件或場景元素。 Smart Resize 依照指定長寬比重新調整畫面,模型會補足延伸出的內容。 Background removal 可移除背景,輸出帶透明背景的主體。 Multi-ref editing 單次生成最多接受 5 張輸入影像,減少手動合成的需求。 來源:@grok(回覆)|Grok Imagine 2.0 的精確編輯功能操作介面,展示局部修改與智慧比例調整。 宣傳影片展示了這些功能的操作情境,包括把矮凳替換成躺著的金毛尋回犬、將扶手椅改成其他樣式,以及把同一個客廳延伸成多種畫面比例。影片也展示資訊圖表、UI/UX 工作區、遊戲 asset 和 storyboards 等產出類型;這些屬於宣傳展示中的範例,不等同於額外公布的規格。 Arena 評測表現 Arena.ai 的資料顯示,Grok Imagine Image 2.0 (Low) 在 Text-to-Image Arena 以 1320 分首次登上第 2 名;前一代 Grok Imagine Image Quality 原本排名第 14。在 Image Edit Arena 中,Image 2.0 (Low) 以 1439 分同樣排名第 2;前一代原本排名第 7。 來源:@arena(回覆)|Grok Imagine Image 2.0 (Low) 以 1,320 分登上 Text-to-Image Arena 排行榜第二名。 來源:@arena(回覆)|Grok Imagine Image 2.0 (Low) 在 Image Edit Arena 排行榜中以 1,439 分獲得全球第二名。 分類表現方面,文字生圖在 Product、Branding & Commercial Design 排名第 3,並在 Art、Portraits、Text Rendering、Cartoon, Anime & Fantasy,以及 Photorealistic & Cinematic Imagery 等分類排名第 2。影像編輯則除了 Art 尚待更多票數累積外,其餘分類都排名第 2。這些名次是 Arena 的群眾評測結果,反映相對排名,不代表所有工作情境下都能取得相同品質。 延伸工作流程 引用的官方說明指出,Imagine Image 2.0 也提供針對常見任務預先配置的 templates,涵蓋照片編輯、產品拍攝、headshots、圖示與遊戲 asset。模型亦能根據少量 prompt 分別生成角色、場景與道具,讓多張影像維持一致風格,作為建立影片世界觀的基礎。整體方向是把影像生成從一次性產出,推向可反覆編輯、調整比例並整合到設計流程的工作工具。 Grok Imagine 2.0 的精確編輯功能操作介面,展示局部修改與智慧比例調整。 影片中的 Prompt 與操作: 操作步驟: 1. (00:05)點擊褐色提袋並套用材質變更 2. (00:10)點擊牆上畫作與家具物件 3. (00:19)點擊綠色矮凳並替換為睡覺的狗 原文:https://easyvibecoding.app/curated/2875-grok-imagine-image-2-0-precise-editing-clear-text

  2. 1 day ago

    Claude Code 跨 session messaging:不同 session 可互傳摘要與變更通知,不必重新解釋背景

    Claude Code 跨 session messaging:不同 session 可互傳摘要與變更通知,不必重新解釋背景。 功能概述 Anthropic 的 Claude Code 團隊表示,更新 Claude Code 後,使用者可以要求一個 session 把目前發現、決策或進度傳給另一個 session,不必在不同終端機之間重新解釋背景。傳送內容是 Claude 撰寫的文字摘要,不包含原始對話紀錄或檔案;若要搬移完整對話與 context,仍應使用 resume session。 實際互動 這項功能支援雙向溝通:目前的 session 可以詢問另一個 session,並把答案帶回原本的工作流程;Claude 也能自行判斷需要通知其他 session,例如某個變更可能影響另一個 session 正在處理的程式碼。官方文件列出的典型用途包括: 傳遞 breaking change、技術發現或已做出的決策。 協調不同 worktree 中的平行開發,通知其他 session 哪些內容已完成。 讓長時間執行的 migration 或測試工作回報狀態。 透過 Remote Control 回覆在其他電腦或網頁上送來的訊息;但跨機器情境只能回覆,不能由目前的 session 主動開始對話。 示範畫面 輔助影片顯示兩個 Claude Code 終端機視窗:左側 claude-user-profiles 將 users.name 改為 users.displayname 後,輸入「tell weekly-digest we renamed users.name to displayname」;右側 claude-weekly-digest 收到通知,發現 digest query 仍讀取舊欄位,便更新 src/jobs/weeklyDigest.ts 並執行 npm test digest。畫面顯示,兩個工作可在各自處理任務時同步介面變更,避免其中一邊完成後才發現另一邊仍依賴舊欄位。 兩個 Claude Code終端機視窗透過指令建立連線並自動交流的介面。 運作方式 Claude Code 會使用 ListAgents 找出可連線的 session,再透過 SendMessage 傳送訊息。可用 /list-agents 或 /peers 查看清單;session 名稱可由 /rename 或 --name 設定,未設定時則依工作目錄自動命名。相同機器上的 session 透過每個 session 的 socket 通訊,不經 Anthropic 伺服器;容器與主機因檔案系統隔離,彼此無法連線,但同一容器內的 session 仍可互傳。 權限與訊息控制 收到的訊息不等同於使用者授權,也不能替使用者核准權限提示、修改 CLAUDE.md 或其他設定;訊息中的 /compact 等指令也只會以純文字呈現,不會被直接執行。接收端原有的權限規則仍然適用,訊息可能被交付、暫存等待核准,或直接拒絕。使用者可用 crossSessionInbound 設為 accept、hold 或 refuse,控制是否接收其他 session 的訊息;暫存訊息最多 100 則,等待核准的對話視窗預設在五分鐘後失效。 跨機器與安全邊界 跨機器訊息會經由 Anthropic 伺服器與 Remote Control 傳遞,而且只能回覆已抵達的訊息。若要要求任何訊息離開本機前都先取得明確核准,可在設定中加入: `json { "isolatePeerMachines": true } ` 若組織要完全停用傳送、列出 session 與接收訊息,官方文件提供的設定如下;這類設定會影響整個組織,應由管理者人工核對後採用: `json { "permissions": { "deny": ["SendMessage", "ListAgents"] }, "crossSessionInbound": "refuse" } ` 版本與限制 跨 session messaging 要求 Claude Code v2.1.224 或更新版本,目前支援 macOS、Linux 與 WSL 2,不支援原生 Windows;Amazon Bedrock、Claude Platform on AWS、Google Cloud's Agent Platform 與 Microsoft Foundry 也不提供此功能。訊息目前僅支援純文字,重複訊息會受到節流,單一 session 等待 Claude 讀取的已接受訊息上限為 50 則。更新 Claude Code 後,可參考跨 session messaging 文件 進一步確認可用性。 Claude Code Docs 的說明頁面標題,背景為深色,上方帶有橘色標誌與「Claude Code Docs」字樣,下方顯示分類標題「Agents and parallel work」以及主要標題「Message your other Claude Code sessions」,並附帶一段簡短說明文字。 兩個 Claude Code終端機視窗透過指令建立連線並自動交流的介面。 影片中的 Prompt 與操作: Prompt(00:02): 告訴 weekly-digest 我們已將 users.name重新命名為 display_name 原文:tell weekly-digest we renamed users.name to display_name 操作步驟: 1. (00:02)使用者在左側 claude-user-profiles 終端機輸入 tell weekly-digest we renamed users.name to display_name 並送出 2. (00:04)系統顯示 Relaying... 並將訊息傳遞給 weekly-digest 3. (00:08)雙方終端機開始同步處理相關程式碼更新與測試 4. (00:12)雙端完成對話與更新,顯示連線成功提示 原文:https://easyvibecoding.app/curated/2874-claude-code-adds-cross-session-messaging-work-updates

  3. 1 day ago

    Claude Code 將 Auto mode 設為 Pro、Max 與 Team 預設,危險指令攔截率達 89%

    Claude Code 將 Auto mode 設為 Pro、Max 與 Team 預設,危險指令攔截率達 89%。 預設模式變更 ClaudeDevs 表示,8 月 14 日起,Pro、Max 與 Team 的新 session 將預設使用 auto mode。這項變更主要有兩個目的:在安全測試中,auto mode 在所有追蹤的安全指標上都達到或超越人工審核;同時減少 Claude Code 執行長時間任務時,因每次 tool call 都等待使用者核准而中斷的情況。若使用者已自行設定預設權限模式,Claude Code 會先顯示一次通知並詢問是否切換;若管理員已釘選預設值,則不會變更。 安全機制與測試結果 auto mode 不會直接放行 Claude 的操作。既有 permission rules 仍會先執行;只有寬到足以授予任意程式碼執行權限的 allow rules 會在 auto mode 中暫時擱置,再由 classifier 檢查每次 tool call 是否具備不可逆、破壞性,或可能把行動帶到使用者環境之外的風險。被攔截後,Claude 通常會自行尋找較安全的做法或向使用者要求許可;hard deny 類動作則必須先退出 auto mode,或由使用者手動執行。若連續遭到 3 次攔截,或單一 session 累計 20 次攔截,Claude Code 會退回人工核准流程。 Anthropic 以 1,053 名付費測試者進行受控研究:測試者看到一個被替換成明顯危險指令的 permission prompt,但實際上不會執行任何危險操作。人工審核只辨識出 13.6% 的危險指令,亦即 1,053 次中有 143 次;auto mode 則攔截 89%,即 937 次。 對照結果顯示,auto mode 攔下 800 個人類使用者核准的危險指令,而人類只攔下 6 個 auto mode 放行的指令。當 session 變長、使用者已經看過 50 個以上的 prompt 後,人工辨識率約降至 5%,auto mode 的攔截率則維持穩定。 Auto mode 以 89% 的有害行為攔截率遠高於人工審查(Human review)的 13.6%。 長時間自主工作 ClaudeDevs 認為,auto mode 特別適合 Claude Opus 5 這類擅長長時間任務的 model。使用者可以在背景啟動一個或多個平行任務,數小時後再回來檢查已完成的 PR,而不必持續看守權限提示。貼文也指出,auto mode classifier 每次 tool call 只會使用少量額外 token;自公告日起,這部分開銷不再計入 Pro、Max 與 Team 的使用量限制。Enterprise 與 API 使用者則要等 auto mode 成為其預設模式後,才會採用相同安排。 來源:@bcherny(回覆)|Opus 5 在 Gray Swan IPI benchmark 的間接 prompt 注入防護測試中取得最佳防禦表現,k=15 攻擊成功率僅 2.0% 使用方式與管理控制 使用者隨時可以按下 Shift+Tab 切換模式。企業管理員可在 managed settings 中釘選 defaultMode,也能以 disableAutoMode 完全停用 auto mode。引用來源補充指出,Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud's Agent Platform 與 Microsoft Foundry 目前仍維持 opt-in,預計在接下來一個月逐步改為預設。即使 Anthropic 認為 auto mode 能降低多數情境的風險,官方仍建議對正式環境基礎設施的高風險變更自行檢查,因為分類系統無法消除所有風險。 引用來源補充的安全案例 Anthropic 的文章將 auto mode 描述為多層防禦的一部分,包括檢查外部網頁、檔案內容與 tool output 是否含有 prompt injection,辨識資料與 secrets 的存取及分享範圍,並在可能執行 git reset --hard 等破壞性 git 操作前檢查 git status。文章也列出三起內部攔截事件:Claude 在內部磁碟上傳失敗後,試圖把報告發布到公開程式碼分享網站;長時間 session 中試圖終止約 2,000 個 pods,並排入可能刪除數百張 GPU 訓練資源的操作;以及在只要求唯讀帳務權限時,誤選可取得帳號根層級完整管理權限的雲端角色。 外部評估與實際採用 引用文章提到,Apollo Research 透過兩週的對抗性測試協助強化 classifier,讓已知與保留攻擊集合的整體漏判率由 12% 降至 7%;但 Anthropic 特別提醒,這些是刻意設計來尋找系統弱點的 synthetic attacks,不能直接視為真實流量的漏判率。在另一項由 Trajectory Labs 執行、涵蓋 72 個 indirect prompt injection 情境、共 720 次攻擊嘗試的評估中,Claude Fable 5、Opus 5 與 Sonnet 5 使用 auto mode 時沒有攻擊成功;GPT-5.6 Sol 在 Codex 的 Auto-review 模式下則為 5.83%。這項評估使用 Trajectory Labs 提供的共用瀏覽器整合,未測試 OpenAI 與 Anthropic 第一方瀏覽器整合內建的 safeguards,因此結果不能直接外推到這些整合。 Anthropic 旗下模型(Sonnet 5、Fable 5 與 Opus 5)在各種權限模式下的 Prompt injection 攻擊成功率均接近 0%,顯著優於 GPT-5.6 Sol 的 5.83% 至 19.03%。 Sonnet 5、Fable 5 與 Opus 5 在工具呼叫任務中的 prompt injection 攻擊成功率不論在 bypass 或 auto mode 下均為 0.00%,表現優於 GPT-5.6 Sol 的 6.80%(Full Access)與 2.00%(Auto-review)。 實際採用方面,Adobe、Nuro、Gusto 與 Garner Health 已將 auto mode 用作生產預設。引用文章表示,Teams 與 Enterprise 採用者產出的 PR 約增加 25%;Garner Health 更透過 managed settings 將預設值推送給 550 名員工。Gusto 自 5 月中旬起約有 10% 的 session 觸發 classifier denial,顯示它確實攔下部分操作,而不只是移除提示。 社群回應與疑慮 Boris Cherny 表示,若結合 model training、input probes 與檢查意圖的 classifier,多層防禦可能讓未見過的 indirect prompt injection 攻擊成功率接近 0%,這是他一年前未預期的結果;他也回應稱 Anthropic「完全信任」auto mode。Fernando Torres 則認為 auto mode 的細節應該開源,以協助整個產業改善安全性,並指出 Claude 訂閱無法用於 third-party agents,是目前使用 Agent 的重大風險之一。其他回應者要求公開更多測試結果,也有人批評這些防護層讓產品不適合嚴肅工作。另有使用者回報,使用會呼叫兩個平行 review subagents 的 skill 時,Opus 5 突然要求使用者核准;Boris Cherny 請對方在該 session 執行 /bug 並提供 feedback id,顯示新預設模式仍可能需要持續除錯與驗證。 原文:https://easyvibecoding.app/curated/2878-claude-code-sets-auto-mode-default-pro-max-team-89-percent

  4. 1 day ago

    Google 分享 Gemini Omni Flash:從文字、圖片、影片或音訊產生並編輯連貫影片

    Google 分享 Gemini Omni Flash:從文字、圖片、影片或音訊產生並編輯連貫影片。 Gemini Omni Flash 於今年 I/O 發表、近期才開放開發者使用。2026 年 8 月 7 日,Google 整理五位開發者的作品,並邀請使用者在 Gemini App、Google Flow、Google AI Studio、Gemini API 與 Gemini Enterprise Agent Platform 體驗這項能力。 產品定位 Gemini Omni Flash 是 Omni 家族推出的第一個模型。Google 表示,Omni 讓影片創作像對話一樣簡單;除了理解物理變化,也結合 Gemini 對真實世界的知識,因此能產生更符合現實邏輯的畫面。Google 最近已開放開發者使用,並以多個個人與專業專案展示其實際用途。 深藍色背景中央顯示「Gemini Omni」字樣,四周環繞著五個帶有藍色邊框的動態畫面截圖,內容包含機器人動畫、黃色檸檬潛水艇插畫、像素風格遊戲畫面、戶外木造涼亭設計提案以及城市街景中的人物。 切換鏡頭與視角 Omni 能在不破壞原始場景連續性的前提下,改變攝影機角度、替換環境,或加入電影感縮放。開發者 Leon Lin(@LexnLin)以一名站在城市街道中央的女子為拍攝對象,製作約 20 種視角,包括近景、遠景、正面、側面、俯拍與仰拍;背景也隨之改變——她時而站在人行道、斑馬線或車道上,周圍的行人、汽車、電車與各式建築也跟著不同。 一名短髮女子身穿黃色風衣站在城市街道中央。 用語音改造環境 Omni 也能改變影片中正在發生的事情,或替換場景內的物件,同時維持畫面的整體連貫。Carlos Santana(@DotCSV)示範只用自己的聲音編輯戶外場景:把白天改成夜晚,加入陰天、雨聲與積雪,讓樹葉轉為橘色,呈現天候與季節逐步變化的效果。 庭園景觀在日夜與天候、季節變化中的外觀差異 讓日常物件動起來 在 Google Flow 中,使用者可以把手繪草圖轉成寫實影片,並用塗鴉指定個別元素的移動方式。Pan(@sebatheepan)將檸檬、咖啡杯、火柴、辣椒與剪刀等日常物品轉化為動畫角色:檸檬成為海中潛水艇,咖啡杯變成熱氣球,火柴成為火箭,辣椒組成受驚時會噴火的沉睡惡龍,剪刀則變成追逐獵物的鯊魚。手繪元素是否保留在最終作品中,也可由創作者決定。 混合視覺風格 使用者可以提供參考素材,或用自然語言描述想要的外觀,讓 Omni 將不同參考融合成風格一致的影片。Jerrod Lew(@jerrod_lew)在 Google Flow 中讓一名女子持續走過街道,影片依序在真人實景、動漫、黏土定格動畫等風格間流暢切換,人物向前行走的動作沒有被中斷。相關畫面也可觀察到低多邊形 3D 與精緻 3D 動畫等轉場效果;這些是示範畫面呈現,不代表 Google 另行公布的正式規格。 一名身穿風衣與紅色圍巾的女士在繁華街頭行走,畫面風格隨不同鏡頭在寫實與多種動畫風格之間切換 把概念轉成可視化內容 Hyperagent 團隊則用 Omni 將抽象想法變成影片,包括把空公園製作成景觀設計提案的施工前後對照、用動畫教授講解商業儀表板資料,以及把待辦事項改造成角色逐項闖關的遊戲。相關畫面顯示,一個景觀提案介面以比較拉桿切換草地實景與木造涼亭渲染圖,並標示「Generated from your video in 4 minutes」;畫面中的提案規格為總價 120,425 美元、工期 7–9 週、14×16 cedar pergola 與 175 株以上原生植物。這些數字屬於示範畫面內容,不能視為 Omni 的官方效能或服務承諾。 介面上的比較拉桿在公園實景與木造涼亭渲染圖之間切換 示範所呈現的延伸方向 同一組 Hyperagent 示範中也把 Omni 用於 8-bit 風格的工作進度儀表板,以及由 Professor Tidemark 以黏土動畫講解成長與首次工作階段流失排查的短片。畫面顯示的儀表板包含 MRR 52,400 美元、淨收入留存率 118%、19 個月 Runway 與 71% Auto-resolve rate;另一段影片則列出每週註冊數 5,010、每週活躍建構者 1,370、7 天啟用率自 9.4% 降到 8.7%、啟用中位時間 38 分鐘,以及每位已啟用使用者成本 312 美元(上升 86%)。這些同樣是媒體中展示的創意案例與畫面數據,並非貼文宣稱的模型基準測試結果。 模擬 8-bit 遊戲風格的工作進度儀表板介面,結合左側數據指標與右側任務日誌。 使用方式 Google 表示,開發者與一般使用者現在可在 Gemini App、Google Flow、Google AI Studio、Gemini API 或 Gemini Enterprise Agent Platform 嘗試 Gemini Omni。完整介紹可參閱 Google 的示範文章。 結合日常實物與手繪線條的定格動畫創意短片。 一名機器人講者正用教鞭指著白板上的成長曲線圖,下方並列展示各項關鍵指標數據。 模擬 8-bit 遊戲風格的工作進度儀表板介面,結合左側數據指標與右側任務日誌。 影片中的 Prompt 與操作: 操作步驟: 1. (00:00)點擊右側日誌的第一項任務「Save Brightline」 原文:https://easyvibecoding.app/curated/2867-google-gemini-omni-flash-generates-edits-coherent-videos

  5. 1 day ago

    MiniMax 推出 MiniMax Code 2.0,手機可遠端監看並介入桌面 Agent 工作

    MiniMax 推出 MiniMax Code 2.0,手機可遠端監看並介入桌面 Agent 工作。 MiniMax 表示,2.0 重建於開源的 Pi Agent 框架(@pidotdev)之上。 以亮藍色藍圖背景為基底的宣傳圖,左側以大字標示「MiniMax Code 2.0」及附有圖示的「Rebuilt from the Core.」標籤,右側懸浮著數個印有程式碼標誌與文字的黑白六角形區塊。 遠端控制 新功能「Remote Control」可把手機連接到既有的桌面 session,查看 Agent 回覆、終端機輸出、程式碼變更與測試結果;使用者也能離開電腦後傳送指示、回答問題或處理核准事項。手機在此扮演的是輕量化監看與介入工具,而非完整工作環境。 MiniMax Code 的介面展示,主畫面呈現筆記型電腦螢幕與右側的智慧型手機畫面,筆電畫面中央顯示標語「MiniMax Code, making work easier.」以及帶有詢問與模型選擇的對話介面,左側為專案與導覽列,右側手機則顯示相對應的專案列表與底部任務按鈕。 瀏覽與編輯 MiniMax Code 2.0 將網頁與 HTML 輸出開在側邊欄,使用者可以直接檢查程式產生的結果,並在預覽面板編輯程式碼、文件或設定檔後儲存,不必在不同應用程式之間切換。 介面設定選項,分為兩大區塊並列顯示:「For coding」標示程式碼圖示且目前處於勾選狀態,下方說明為「More detail and dev tools」;右側為「For everyday work」標示對話氣泡圖示,下方說明為「Same power, simpler view」。 雙模式工作流 Coding 模式保留開發脈絡與程式碼管理工具,適合執行程式開發任務。 Work 模式簡化技術細節,讓使用者專注於進度與最終交付成果。 模型與提供者設定 使用者可連接 MiniMax API Key,也能透過 Base URL、API Key 和 Model Name 加入自訂 provider。完成設定後,該模型會出現在 model picker 中,可用於各類任務。官方提供下載更新:MiniMax Code。 原文:https://easyvibecoding.app/curated/2869-minimax-code-remote-monitor-desktop-agent

  6. 2 days ago

    OpenAI 更新 ChatGPT:GPT-5.6 Sol 統一支援 Plus 與 Pro 對話,GPT-5.6 Luna 開放免費無限文字聊天

    OpenAI 更新 ChatGPT:GPT-5.6 Sol 統一支援 Plus 與 Pro 對話,GPT-5.6 Luna 開放免費無限文字聊天。 更新重點 OpenAI 在 2026 年 8 月 7 日表示,GPT-5.6 Sol 已成為 Plus 與 Pro 使用者所有 ChatGPT 對話的核心模型,涵蓋 Instant 與較深度的 reasoning,目標是提供更聚焦、可靠且一致的回答。Free 與 Go 使用者則獲得 GPT-5.6 Luna 的無限文字聊天;面對較複雜的問題,也能使用新的「Think」按鈕要求模型投入更多 reasoning。 GPT-5.6 Sol 改進 這次更新針對 ChatGPT 的日常對話體驗,重點包括: 優先直接回答問題,減少不必要的格式與細節。 依問題難度調整回答長度;處理規劃、研究、寫作或多步驟任務時,仍保留完整脈絡。 當單純同意使用者並無幫助時,主動提出適當修正。 Plus 與 Pro 使用者可在網頁、手機與桌面版 ChatGPT 使用滑桿,調整每次回答投入的思考量。影片畫面顯示選項可在 5.6 Instant、5.6 Medium、5.6 High 與 5.6 Extra High 之間切換。 星空背景中的手機畫面,淺色 ChatGPT 介面顯示 Ask ChatGPT 輸入框與 5.6 Medium 調整選項 可靠性評測 OpenAI 引用涵蓋金融、醫療與法律問題的內部評測指出,回答至少包含一項事實錯誤的比例,相較 GPT-5.5 Instant,GPT-5.6 Luna 約少 62%,GPT-5.6 Sol 則少 68%。官方將改進歸因於模型更善於運用找到的來源,尤其是回答涉及日期、數字、規則、來源或前提假設的問題時。原文也以自行車騎乘天氣問題示範:GPT-5.6 Sol 先回答「不會被雨淋濕」,再指出真正需要注意的是前往 Ocean Beach 時的逆風與降溫,而不是重複完整天氣預報。 比較 GPT-5.5 Instant 與 Updated GPT-5.6 Sol 兩款模型對同一通勤氣象問題的回答介面,上方顯示使用者輸入的問題文字,下方左右兩欄分別呈現不同版本的詳細天氣分析與建議,右側版本附有帶時間、天氣狀況與降雨機率的 San Francisco, CA 表格。 免費使用擴大 GPT-5.6 Luna 將在本週成為 Free 與 Go 使用者的預設模型;自下週起(官方文寫下週起、發布當日推文則稱隔日起),兩種方案可無限進行文字聊天,並透過「Think」按鈕處理需要較深思考的問題。這項擴大服務仍受 abuse guardrails 約束,檔案上傳、圖片與其他工具也仍有使用限制。背景脈絡是 ChatGPT 每週已有 10 億人使用,OpenAI 希望降低持續提問與發展想法的門檻。 宣傳 GPT-5.6 Luna 無限文字對話服務的星空背景圖 範圍與限制 Plus 與 Pro 使用者可從今日開始使用更新後的 GPT-5.6 Sol 與滑桿;Free 與 Go 使用者則依上述時程取得 GPT-5.6 Luna。這個版本的 GPT-5.6 Sol 是為日常聊天最佳化,因此只會出現在 ChatGPT 的 Chat 體驗中;支援 Work 與 Codex 的 GPT-5.6 Sol 不在本次發布範圍內。更多安全訓練與未滿 18 歲使用者的評測,可參考 OpenAI 的官方說明。 原文:https://easyvibecoding.app/curated/2873-openai-gpt-5-6-sol-unifies-plus-pro-chats-luna-unlimited-free

  7. 3 days ago

    Prime Intellect 開源 Prime Agent:harness 讀自己的執行軌跡改寫 prompt 與 skill,搭 Opus 5 在 ARC-AGI-3 勝人類專家基準

    Prime Intellect 開源 Prime Agent:harness 讀自己的執行軌跡改寫 prompt 與 skill,搭 Opus 5 在 ARC-AGI-3 勝人類專家基準。 產品定位 Prime Intellect 將 Prime Agent 定位為通用程式開發 harness,也適合研究與長時間自主評測(long-horizon autonomous evaluation)。官方表示,它不只針對單一 benchmark 設計,在 ARC-AGI-3 上以 Opus 5 取得 95.5% 成績,超過人類專家基準 95.4%;團隊也稱,Prime Agent 在多項長上下文與長 horizon 任務中,相較模型原本搭配的專有 harness,能讓開放權重與封閉模型的下游表現更好。 Prime Agent 搭配 Opus 5 在 ARC-AGI-3 達到 95.5%(179/183 levels),超越圖上標示的人類專家 baseline 95.4%;同圖其餘搭配為 Prime Agent + Sol 的 78.3%、+ Terra 的 25.7% 與 + GLM 5.2 的 8.6%;圖上的對照組為 GPT-5.6 Sol 的 ARC-AGI-3 harness 13.3%、Claude Opus 5 的 ARC-AGI-3 harness 30.2%,以及 GPT-5.6 Sol 走 Responses API 的 38.3%。 Prime Agent 建置於 pi 之上,採完全開源與 MIT License。 三個核心設計 Prime Agent 將三種機制組合在同一個執行環境中: RLM-native programmatic tool calling:模型把 context 視為變數,並在持續運作的 REPL 中以程式碼操作歷史內容、呼叫工具與啟動 sub-agents。 Persistent multi-agent orchestration:sub-agents 能並行或在背景執行,彼此直接傳送訊息,並保留自己的工作狀態。 Self-improving Continual Harness:harness 可保存並更新 prompt、記憶、skill 與 sub-agent 規格,讓 Agent 根據實際執行軌跡逐步調整工作方式。 單一 turn 與 Continual Harness 迴圈的架構圖,圖上標示 MODEL、IPYTHON KERNEL、SUB-AGENTS 與 CONTINUAL HARNESS;圖說寫明 Continual Harness 讀取跨 turn 的執行軌跡並寫回 harness 狀態 RLM 執行模型 Prime Agent 的模型使用持續存在的 IPython kernel,並將它視為唯一的工具介面。檔案操作、Shell 命令、工具呼叫、context 管理與 sub-agent 啟動,都能由模型在 kernel 中以程式碼完成。這讓長 session 不必把所有歷史重新塞回 active context;模型可以把有用資料保存在變數或外部狀態中,把長時間工作變成可以用程式管理的問題。 RLM 架構圖,說明讓 LLM 透過 persistent Python REPL 來檢查與轉換輸入資料,並在該 Python REPL 內呼叫 sub-LLMs 的運作機制。 多 Agent 與持續工作 rlm(...) 能建立真正的子 Agent,每個子 Agent 都擁有自己的模型、IPython kernel、session tree 與對話歷史。Agent 之間可透過 daemon 傳遞訊息,協調平行工作、追蹤進度或處理共用資源;官方說明這類訊息傳遞限於同一個「核心家庭」,也就是父、子與兄弟 session 之間。Prime Agent 也支援 background session、heartbeat、schedule、persistent goal 與 bounded autonomous mode,官方提醒通過的 gate 只驗該 gate 檢查的項目、達到上限並不代表任務成功;即使終端機中斷,工作仍可在背景繼續,之後再重新連線。官方展示的使用情境包括 EmulatorBench、Factorio、MazeBench,以及從零以 Rust 建立 SEGA Genesis 與 Game Boy Color emulator。 Prime Agent + GPT-5.6 Sol (xhigh) 在 EmulatorBench 的 GAME BOY COLOR 測試中達到 0.998 分數;圖上另外三種搭配(Codex + GPT-5.6 Sol、Prime Agent + Claude Opus 5、Claude Code + Claude Opus 5)皆為 0.000。官方標示 EmulatorBench 為 preview benchmark,數字是 16 次重建平均的初步結果 執行 Prime-Agent 配合 GLM-5.2 在 MazeBench 上的迷宮導航與測試過程 Continual Harness 與 skill harness 狀態會持續寫入磁碟,並在不同 turn 與 session 間保留。/refine 會檢視 Agent 過去嘗試及其結果,對 prompt note、記憶、skill 或 sub-agent 規格做最小、有證據支持的修改,而不是重寫整個 harness。基礎 system prompt 維持不可變更,更新也會留下歷史紀錄並支援 rollback。這裡的 skill 是可匯入的 Python package,可由內建 skill creator 將重複性的工作流程整理成專案或個人 skill。 Prime Agent 相比各模型專有與原生 harness,在 9 項長上下文與長 horizon benchmark 的多數對照中分數較高,但並非全部:Opus 5 的 OOLONG 為 0.900 對 Claude Code 的 0.920、LongBenchv2 為 0.744 對 0.746,GPT-5.6 Sol 的 OBLIQ-Bench 為 0.612 對 Codex 的 0.646、LongCoT-Mini 為 0.671 對 0.681、ManyIH IF 為 0.216 對 Codex 的 0.232,GLM-5.2 的 LongBenchv2 則是 0.680 對 Pi-Mono 的 0.696。EmulatorBench 的 Opus 5 兩欄(0.047、0.062)帶星號,官方說明 Opus 的 run 未能解出任務。 評測結果 Prime Intellect 表示,Prime Agent 在 ARC-AGI-3 上以 Opus 5 取得 95.5% 的 RHAE Best@1(圖上標示該次通過 179/183 個 levels),三次執行分數為 95.0%、95.2% 與 95.5%;三次合計的 Best@3 分數為 99.97%,且 183 個 levels 全數至少通過一次。官方也指出,透過程式化函式直接處理資料,能在達到較高分數的同時降低整體 token 使用量。影片畫面另顯示另一次執行的中途狀態,從 93.39%(164/183 levels)更新至 95.54%(178/183 levels、11,118 actions),並將 Prime Agent 的 95.5% 與 native coding harnesses 的 38.3%、人類基準 95.4% 並列;這些是畫面展示的數據,不是額外的正式評測規格。 開源與安裝 原始貼文提供的安裝方式如下;官方文件說明該 installer 會下載已版本化的發行版並驗證其 SHA-256 checksum。(編按)它仍是透過網路下載、直接交由 Shell 執行的指令,建議先確認內容、權限與執行環境再執行: 介紹 Prime Agent 程式碼 harness 的安裝指令與 ARC-AGI-3 基準測試表現 `bash curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh ` 專案原始碼可見於 Prime Agent GitHub repository,發布說明則見 Prime Intellect 官方部落格。文件特別警告,Prime Agent 會以使用者權限執行模型產生的 Python 與專案命令;它的 worker 與 kernel 生命週期隔離、復原機制都不是 security sandbox,所以要用可信任的 repository、指示、skill 與 extension,並在可檢查、可還原的工作副本或外部沙盒中執行不受信任的程式碼。 介紹 Prime A…

About

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

You Might Also Like