EasyVibeCoding Podcast

EasyVibeCoding

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

  1. 1d ago

    Anthropic:Claude 如何輔助科學研究

    Anthropic:Claude 如何輔助科學研究 AI 會寫程式、讀論文、整理資料,但這些能力怎麼轉成有意義的科學發現?Anthropic 的訪問研究員、哈佛物理學家 Matthew Schwartz 在一篇客座文章中提出一個做法:別要求模型照著人類研究者的習慣一路合作,而是挑選它擅長的問題,替它備好工具與檢查程序,再請領域專家判斷答案值不值得追下去。 Schwartz 把這類適合現有大型語言模型處理的問題稱為「Claude-shaped problems」。他描述的落差是,研究者常希望 AI 像人類科學家一樣形成概念、辨別重要性;但目前的模型更能發揮在知識廣度、數學與程式,以及大量閱讀資料上。若任務需要難以形式化的判斷,單靠模型產生答案就很難知道它是否真的有用。 先把計算做成可檢查的工作 Schwartz 從數學物理開始,和 Claude 一起建立 BootLoops:一組用於定量科學的工具與研究程序。文章以費曼積分為例。半數值 bootstrap 先用物理條件縮小可能解的範圍,再以少數高精度數值計算找出剩下的係數;得到的解析結果也能用數值重新檢查。這種步驟明確、能交叉驗算的工作,比直接請模型回答開放式的深層概念問題,更適合交給代理工具處理。 Schwartz 表示,BootLoops 把 30 個積分從頭到尾算完,其中 15 個重現已知結果,另外 15 個此前尚未計算。這些數字說明該團隊如何描述工具的早期成果;它們來自作者的研究報告,並非跨模型或跨研究團隊的效能比較。 跨領域連結要有人判斷價值 計算方法相似時,數學工具可能在不同學科派上用場。Schwartz 說,Claude 把物理方法連到生態學與族群遺傳學,也提出許多跨領域的計算。但「算得出來」不等於「問題重要」:他回憶,許多結果在技術上正確,起初卻不會讓該領域研究者感到意外。專家加入後,研究問題才逐步轉向學科真正關心的方向。 在生態學案例中,Schwartz 與植物生物學家 James O’Dwyer 先用 Claude 求解一個長期難以大規模處理的方程,並將方法用於巴拿馬巴羅科羅拉多島的森林資料。Schwartz 原本注意到樹種組成變化速度約為中性理論預測的 4.5 倍;O’Dwyer 指出,這個結果本身可能不會改變生態學家的看法,並建議研究兩者差異,以分辨自然選擇、競爭與物種差異的作用。兩人接著與 Claude 一起建立生命史預測模型。這個例子呈現的不是模型獨力完成研究,而是模型提供可用的計算,人類專家把結果導向有解釋力的問題。 族群遺傳學的經驗也有相同轉折。Claude 先用數學物理方法解出一個描述自然選擇如何影響稀有突變的積分,並將計算應用於 gnomAD 人類基因變異資料庫。Schwartz 邀請熟悉該領域的研究者檢視後,對方認為更有意義的切入點,是同一染色體上突變對的關聯。團隊於是分析 1000 Genomes Project 基因組中的 57 億對鄰近突變,並報告找到基因轉換的證據。這項結果與後續研究方向都是客座文章的作者報告;文章也說明,專家建議改變了研究問題。 相似的人機分工出現在其他案例:作者與經濟學家合作,把五本期刊 4,452 篇論文的複現套件轉成開源程式並核對可驗證的數字;與語言學家合作建立涵蓋 6,072 種語言的重音資料庫,並為幾乎每筆資料附上判定依據。文章還列出地球科學、系統發育、天文與統計等探索中的計畫。Schwartz 表示,這批工作涉及 18 個領域、36 篇手稿與 19 位共同作者,從約 400 個候選問題中展開,歷時三個月。這些規模數字說明團隊的研究活動,不是模型準確率或生產力基準測試。 工具不能替代學科判斷 這篇文章的核心經驗,是把模型放進可執行、可驗算的計算流程,再讓研究者決定哪些結果值得深入。工具降低了重複計算與跨領域移植方法的門檻;專家則協助辨認結果是否新穎、問題是否重要,以及下一步該如何改寫。即使 Claude 找到一個技術上成立的答案,也還需要有人理解其學科脈絡。 這些案例來自一位參與研究的作者所寫的客座文章,並非獨立的整體效能評估。Schwartz 在文中指出,多項成果仍在擴展與進一步驗證;因此,較穩妥的讀法是把它們視為一套正在發展的人機研究方法及其案例,而不是模型已能普遍自主完成科學研究的證明。 閱讀 Anthropic 客座文章〈Claude-shaped science〉。 文章封面將物理示意圖與林木影像並置,呈現跨領域科學研究主題。 示意圖以兩個重疊區域呈現科學家想研究的問題與 AI 能處理的問題,並標出「Claude-shaped problems」的交集。 原文:https://easyvibecoding.app/curated/3415-anthropic-claude-science-research

  2. 1d ago

    OpenAI Dots 示範:把一段工作交給能持續行動的代理

    OpenAI Dots 示範:把一段工作交給能持續行動的代理 OpenAI Developers 的 Dots 示範回放,從一場「昨天沒照計畫進行」的發表示範重新開始。這次重播要呈現的重點,不只是回答問題,而是把一段需要多步處理的工作交給代理繼續推進。 旅遊情境中,使用者用語音交代隔天的洛杉磯行程。Dots 比較照片與地圖資訊,挑出 Silver Lake Pool and Inn 作為選項;示範者接著說,還要確認一晚住宿的總價與取消條款,機票也仍在處理。這段展示的是代理如何協助縮小選擇、接續待辦,並沒有證明住宿或機票已完成交易。 示範先整理回饋分類;串起 PR、重測與 Slack 回覆是後續提出的需求,未在本片展示完成。兩段流程共同呈現 Dots 的產品方向:代理在不同工具之間延續一項任務,並把尚未完成的部分留在工作脈絡裡。 OpenAI 的產品介紹將 Dots 描述為可持續運作、能連接多種應用的代理。這場示範提供了更具體的操作例子;實際可靠度、授權邊界與任務完成情形,仍應以各步驟的可見結果判斷,而不能只由示範影片推及所有使用情境。 約 9 分 10 秒的 OpenAI Developers Dots 示範回放:先以語音安排隔日洛杉磯行程、比較照片與地圖後選擇 Silver Lake Pool and Inn,並表示將核對一晚訂房的總價與取消條款;結尾明說機票仍在處理中。示範先整理回饋分類;串起 PR、重測與 Slack 回覆是後續提出的需求,未在本片展示完成。另談到可靠性、行動裝置體驗和通知。畫面中的介面抽樣支持這些主題;影片沒有證明航班或旅館交易已完成。 影片畫面重點時間軸1:28 此抽樣畫格仍是對鏡頭說話者與筆電畫面,僅作場景脈絡,無法單靠畫格證明相鄰語句。7:05 此抽樣畫格為說話者與筆電的演示場景;不將畫面當成逐字語音證據。8:51 Dots 聊天畫面同時呈現地圖/旅館區域與文字摘要:回饋主題的可靠性列為最大類別,標示近期 386 個訊號中 131 個;提及行動裝置可見度與通知路由反覆出現、原因可能不同。旁側是結帳/訂房畫面,但本截圖不足以讀清完整價格與條款,也不能據此宣稱已購買。9:09 尾端抽樣畫格為黑畫面。 原文:https://easyvibecoding.app/curated/3414-openai-dots-demo-agent-workflows

  3. 4d ago

    ChatGPT Space 開放 Pro、Business、Enterprise 桌面與網頁版;協作投影片預告於未來數週推出

    ChatGPT Space 開放 Pro、Business、Enterprise 桌面與網頁版;協作投影片預告於未來數週推出。 Space 把對話接成可共同維護的工作 ChatGPT Space 是團隊、ChatGPT 與 dot 依共同知識持續協作的共享空間;dot 本身是獨立的個人 AI agent,不是 Space 的另一個名稱。Space 可依提供的指示整理內容,讓團隊接續工作。當你要求把對話整理成頁面或投影片時,它會先問問題釐清需求,再在畫面中產生草稿;成員可以直接編輯、請 ChatGPT 再改,或邀請其他人一起完善,不必先把脈絡搬去另一套文件工具。Space 適用於 Pro、Business、Enterprise 桌面與網頁版;行動版當時仍是即將推出。 三種成果形態 動態頁面適合持續更新的計畫、報告或追蹤表。頁面可包含圖表、互動式儀表板和圖片;成員能留言、直接編輯、標註 ChatGPT 或 dot 交辦修改,也可依已連接工具的資料自動更新。適用於 Pro、Business、Enterprise。 協作投影片(公告時預告於未來數週推出)可由多位成員與 agents 同時編輯並留言,也可從對話開始或套用自己的範本;投影片可在 ChatGPT 內播放,再匯出 PowerPoint 或 Google 簡報並保留格式。方案同為 Pro、Business、Enterprise。 團隊與任務則把共享頁面、簡報、試算表與例行工作放進協作流程。Business、Enterprise 可建立排程任務,例如每週彙整專案進度;也可依新郵件或 Slack 訊息等變化,透過連接工具收集資訊並採取動作。團隊成員能共同調整指示,讓任務跟著優先順序改變。 工作不必離開團隊常用入口 Business、Enterprise 可在 Slack 或 Microsoft Teams 的頻道、討論串、私訊中提及 @ChatGPT,將討論整理成專案摘要、調查錯誤並準備修正建議,或定期更新客戶狀態。它可以使用管理員已連接的工具,或使用者授權的工具;沒有個人 ChatGPT 訂閱的同事也能在同一段對話補充背景。 Meetings 外掛會把個人化會議摘要與待辦存進 Space,筆記可保持私人或分享給團隊;音訊在筆記完成後即刪除,不能存取或重播。官方舉例是會後請 ChatGPT 更新專案計畫或草擬後續訊息。公告當時的 beta 適用 ChatGPT macOS 桌面應用程式上的 Pro 與 Business 使用者,Enterprise 即將推出。 因此,閱讀方案時要分清楚:Space、動態頁面與協作簡報列在 Pro/Business/Enterprise;團隊共享任務與 Slack/Teams 的 @ChatGPT 是 Business/Enterprise;會議外掛當時只有 Pro/Business beta。@reach_vb 的 DevDay 貼文是發布清單,不是 Space 細節來源。詳情以 OpenAI DevDay 2026 回顧 為準。 原文:https://easyvibecoding.app/curated/3407-chatgpt-space-pro-business-enterprise-teams-collaborate-edit

  4. 4d ago

    OpenAI 推出 Dots 個人 AI agent,先從適用市場的 Pro、Business Premium 和 Enterprise beta 開始

    OpenAI 推出 Dots 個人 AI agent,先從適用市場的 Pro、Business Premium 和 Enterprise beta 開始。 從交代目標到交付可檢查成果 使用者先建立一個 dot、替它命名、連接所需應用,再說明目標、標準與它能自行處理的範圍。Dot 由 GPT‑6 Astra 驅動,能從回饋中持續學習,並有獨立的雲端電腦和瀏覽器,OpenAI 表示它可透過外掛生態系連接超過 4,000 個應用程式;使用者可隨時查看它的雲端電腦並檢查進度;使用者的電腦與內容預設保持分開,也可選擇授權 Dot 連接筆電,讓它在旁協助。它能同時推進多個專案,過程中可透過 ChatGPT 對話或語音通話補充想法、回答問題與給回饋。 OpenAI 提供的工作情境說明這個循環:開發者的 dot 追蹤客戶回饋,整理常見需求,規劃較小的修正、實作並測試,再交付附有變更影片的 pull request(PR,程式碼合併提案)供人審查;產品負責人的 dot 依新範圍更新上市材料;研究者的 dot 隨新資料重跑分析、更新圖表並標出需要檢視的結論;內容創作者則可讓它從訪談逐字稿挑選片段、整理節目筆記和社群草稿。早期測試者的例子是:dot 發現忘了向刊物開帳單,先備好發票,再等使用者批准後寄出。 跨工具持續工作,但由使用者掌握界線 Dot 可在 ChatGPT、Slack、Microsoft Teams 間接收訊息,並把跨管道的上下文接續起來;簡訊支援當時仍是即將推出。使用者選擇哪些應用能連接,並可用 Custom Rules 設定允許、必須先核准或禁止的動作。背景主動研究使用唯讀工具,不能傳訊息、修改應用內容或控制瀏覽器;若監控偵測到安全疑慮,工作可能暫停。Dot 的 auto-review(自動審查)會檢查可能影響帳戶或對外分享資訊的動作;例如改密碼等敏感操作仍由人親自完成。 推出方式與用量 Dots 先向符合資格市場中的 Pro 與 Business Premium 使用者推出;公告沒有列出市場名單或具體深度工作額度。Enterprise 使用者(包括 Edu、Healthcare)須由工作區管理員啟用 beta。Pro 或 Business Premium 方案包含第一個 dot,不另收費,並附有深度工作的額度;推出後第一個月有延長限額。與 dot 的一般對話不計入 ChatGPT 使用上限,但若請它啟動或管理 Codex、ChatGPT Work 任務,這些任務照常計入用量。開始設定需使用 ChatGPT 桌面應用程式或桌面瀏覽器連接應用;完成初始設定後,也能在 ChatGPT 手機 App 傳訊息。 現在可建立一個主要 dot;多個 dots 組成團隊是 OpenAI 描述的未來方向。企業專用的 specialist dots 另處於聚焦試點,具獨立身分、憑證和系統整合。來源:OpenAI dots 產品公告、Sam Altman 的發布貼文。 原文:https://easyvibecoding.app/curated/3405-openai-launches-dots-gpt-6-astra-continuous-task-work

  5. 4d ago

    OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一

    OpenAI 推出 GPT‑6.1 Sol,在高難度任務接近 GPT‑6 Astra 的表現,標準輸入與輸出 Token 價格約為 Astra 的五分之一。 OpenAI 公布的測試:看任務,也看條件 | 測試 | 公告中的比較結果 | 測試範圍與閱讀限制 | |---|---|---| | DeepSWE v1.1 | Sol 在真實程式碼庫的長程軟體工程任務上,分數追平 Astra,單任務成本約為五分之一;比 GPT‑6 Sol 的最佳分數高 6.4 個百分點,而且推理 effort 較低。 | 評估代理在原始程式碼庫中完成複雜工程任務。 | | GDP.pdf | 在複雜 PDF 問答上,Sol 分數高於含 fallback 的 Opus 5.5,單次任務成本不到一半;接近 Astra 時,成本約為五分之一。 | 文件含表格、圖表、示意圖與細字,來自金融、醫療、法律等十個專業領域。 | | AutomationBench | medium effort 下,比 Opus 5.5 高 2.2 個百分點、成本約三分之一;比 GPT‑6 Sol 同設定高 4.8 個百分點。 | 以 47 種工具跑銷售、行銷、營運、客服、財務、人資的端到端流程。OpenAI 指出 Claude Fable 5.1 的成本未計入約 40% 任務使用的 fallback。 | | OSWorld 2.0 offline | max effort 比 GPT‑6 Sol 高 7 個百分點;與 Astra 相差 2.1 個百分點,成本約為 Astra 的七分之一。 | 以 2026-08-08 離線資料集評估電腦操作工作流程,採 partial reward;不是完整互動式線上測試。 | | Terminal-Bench Science 0.1 | max effort 的 Sol 每任務平均 5.47 美元,低於 Opus 5.5 的 23.21 美元與 Astra 的 23.80 美元;但 Astra 仍以 68.1% 得分居首。 | 涵蓋資料分析、模擬與定理證明;最難的科學研究任務,OpenAI 仍建議使用 Astra。 | OpenAI 也報告,在使用者曾標記舊模型錯誤的困難提示中,low effort 的事實錯誤比例由 GPT‑6 Sol 的 11.4% 降至 7.7%;所有 OpenAI 模型測試在研究環境或 API 執行,與正式 ChatGPT 的系統提示、工具和 effort 可能不同;競品數據取自公開報告。 獨立的整體指標:Artificial Analysis Artificial Analysis(AA)的 Intelligence Index v4.3.2 將十項評估加權成一個分數:Agents 30%、Coding 20%、Scientific Reasoning 20%、General 30%。該指標以文字、英文測試為主。AA 於 2026 年 9 月 29 日列出 Sol(max)52 分、GPT‑6 Astra 53 分;每項 Index 任務成本分別為 0.72 與 3.26 美元。AA 估計整體指數的 95% 信賴區間小於 ±1%,但這是依部分模型各評估重複十次以上所得;單一評估的區間可能較寬。 | 評估來源 | Sol(max) | Astra(max) | 可以怎麼讀 | |---|---:|---:|---| | AA Intelligence Index v4.3.2 | 52 分;每項 Index 任務 $0.72 | 53 分;$3.26 | 跨十項評估的加權指數與任務成本;AA 同時指出 Sol 比 GPT‑6 Sol 多用約 10–30% 輸出 Token。 | | OpenAI 各項任務 | 各測試分開報告,沒有單一總分 | 各測試表現不同 | 上表保留測試名稱、推理設定、資料版本與成本條件;結果由 OpenAI 公布。 | 價格、入口與適用情境 OpenAI API 標準價為每百萬輸入 Token 2 美元、快取輸入 0.10 美元、輸出 10 美元;快取價比標準輸入低 95%,適合重複引用長上下文的代理流程。Plus、Pro、Business、Enterprise、Edu 可在 ChatGPT Work 與 Codex 使用,模型當時尚未提供於一般 Chat;API 型號為 gpt-6.1-sol。同日中文發布頁稱 Astra 與 Sol Ultrafast 一併推出,但英文評測頁寫 Sol Ultrafast 將於接下來幾天推出,Tibo 貼文也稱即將推出;兩個語言版本對 Sol Ultrafast 的推出時點記載不同。 綜合官方任務測試與 AA 指數,Sol 的吸引力在於把長程程式開發、文件理解、多步驟辦公與電腦操作的能力放進較低的任務成本。來源:OpenAI GPT‑6.1 Sol 評估與定價、Artificial Analysis 發布分析、AA 指數方法。 原文:https://easyvibecoding.app/curated/3404-gpt-6-1-sol-benchmarks-openai-artificial-analysis-cost

  6. 4d ago

    OpenAI 開放 Agents API 電腦操作預覽並更新 Codex;Decisions API 公告時為限量預覽,當時預計接下來幾天全面推出

    OpenAI 開放 Agents API 電腦操作預覽並更新 Codex;Decisions API 公告時為限量預覽,當時預計接下來幾天全面推出。 Codex Cloud:先備好環境,任務再跨裝置接手 Codex Cloud 可讓使用者在電腦執行 Codex、用手機遠端操作,或從其他裝置在雲端使用。可重複利用的開發環境讓後續任務較快啟動;團隊也能共用已核准設定與權限的環境。對需要長時間跑任務、在外查看進度,或讓團隊採用一致工具配置的工作,重點是環境可持續沿用,不必每次從頭準備。DevDay 回顧列出的方案為 Plus、Pro、Business、Healthcare、Education 和 Enterprise。 Codex CLI:用語音派工,也看得見多個 Agent Codex CLI 加入語音聊天,可用語音啟動工作並在執行中引導方向;/agents 檢視畫面可把工作分給多個 Agent、同時追蹤任務進度。日常操作也增加編輯提示、繼續既有工作階段與內建 worktree(隔離工作目錄)支援,並整理終端介面,方便閱讀較長的執行過程。這些更新聚焦在「派工、續跑、並行監看」,而非要求使用者把終端工作改成單次問答。 Agents API:把任務邏輯留在你的產品,底層執行交給代管服務 Agents API 以代管方式提供 Codex 任務執行框架。應用程式定義任務、接上要用的工具與資料,並向使用者呈現進度;OpenAI 維運執行基礎設施。API 支援多 Agent、工具搜尋與呼叫、上下文壓縮,以及新增的 computer use(操作軟體介面以完成任務)。Tibo 在發布貼文指出,這是支援 OpenAI 雲端 agents(包括 dots)的同一套技術,並特別點出可配置的雲端環境與電腦操作。API 可供開發者使用;每月 500 美元的 Pro 訂閱者及符合資格的 Enterprise 客戶,也可在 Codex 和 ChatGPT Work 使用相關能力。 同一場發表另有兩個相鄰但不同的功能:ChatGPT 桌面應用程式中的 Codex 程式碼審查可先看摘要、再檢查差異並向 Codex 詢問問題,也可設定雲端初步審查 GitHub PR 或 GitLab merge request;Codex Security Cloud 可持續檢查新提交,並對 GitHub 儲存庫進行手動或排程掃描,調查、去重與修正於雲端執行。 Decisions API:限定選項的快速判斷 Decisions API 把 OpenAI 的 Luna 模型導向開發者預先定義的問題與有限答案集合,輸入可含文字或圖片,輸出能用於內容分類、請求路由或決定 Agent 下一步。這適合答案空間可先列清楚的快速決策;公告時是限量預覽,OpenAI 當時預告未來幾天全面推出。OpenAI 回顧稱 Agents API 可透過 API 使用;Tibo 的發布貼文則指出,支援 computer use 的 Agents API 進入 preview。Decisions API 另是限量 preview,兩者的功能與供應條件不同。來源:OpenAI DevDay 2026 開發者功能回顧、Tibo 對 Codex Cloud 與 Agents API 的貼文。 原文:https://easyvibecoding.app/curated/3406-openai-updates-codex-cloud-computer-use-agents-api-preview

  7. 5d ago

    Claude Code 在執行任務途中觸及五小時上限時會嘗試平順收尾,使用一筆小額固定額度扣自每週上限;推出期間 Pro 每週可用一次,Max 與 Team Premium 每次觸及上限時可用;所附官方貼文未載明額

    Claude Code 在執行任務途中觸及五小時上限時會嘗試平順收尾,使用一筆小額固定額度扣自每週上限;推出期間 Pro 每週可用一次,Max 與 Team Premium 每次觸及上限時可用;所附官方貼文未載明額度數值。 影片取樣畫面顯示工作階段已達使用上限並正在收尾,之後完成收尾;完整 12 秒音軌只有音樂與環境音,沒有口語。這段錄影是介面示範,不能證明不同方案的實際扣除額度或任務都能完成。公告指出,推出期間 Pro 每週可用一次;Max 與 Team Premium 在每次觸及五小時工作階段上限時可用。公告也表示,若收尾後需要繼續,可以使用額外用量(extra usage)。這筆小額固定額度會從每週上限扣除,所附官方公告未載明額度數值,也沒有保證每個任務都能完成收尾;實際可用情況以帳戶當下顯示為準。 來源:@ClaudeDevs|取樣畫面顯示使用量已達上限並正在收尾,之後完成收尾;畫面顯示 11:55 AM 重設時間。完整音軌只有音樂與環境音,未聽見口語。 取樣畫面顯示使用量已達上限並正在收尾,之後完成收尾;畫面顯示 11:55 AM 重設時間。完整音軌只有音樂與環境音,未聽見口語。 影片中的 Prompt 與操作: Prompt(00:00): 當 token 輪替時,session cookie 沒有被重新整理,導致使用者在 15 分鐘後被登出。你可以修復 src/auth/session.ts 中的這個問題並更新測試嗎? 原文:The session cookie isn't refreshed when the token rotates, so people get logged out after 15 min. Can you fix it in src/auth/session.ts and update the tests? 操作步驟: 1. (00:00)已開始讀取 session.ts 原文:https://easyvibecoding.app/curated/3392-claude-code-graceful-five-hour-wrap-up

About

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。