EasyVibeCoding Podcast

EasyVibeCoding

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。

  1. 3 giờ trước

    Nous Research 推出 Hermes Business:團隊共用餘額並設定成員支出上限

    Nous Research 推出 Hermes Business:團隊共用餘額並設定成員支出上限。 團隊可在 Nous Portal 建立 Business 帳號並邀請同事。 團隊協作 Hermes Business 以共用資源與集中管理為核心: 每位成員都能使用跨通路 AI 助理,團隊共用一個中央餘額,管理者可設定個別成員的支出上限,並在 Portal 查看支出。 成員透過 電子郵件 邀請加入;擁有者與管理員可管理角色、額度與 API 金鑰,其他成員登入後即可使用。 成員建立的 Skills 會放進團隊共用庫,供其他成員的 AI 助理使用;團隊也能累積記憶與工作流程。 Hermes Business 可使用 Nous 推論 API 上的所有模型,也支援接入團隊自己的模型供應商金鑰。 帶有強烈動態模糊效果的深藍色城市街景,兩側高樓大廈的線條向中央匯聚,呈現出彷彿高速移動中的視覺張力。 部署分流 Business 由 Nous 代管,團隊可自行設定,資料放在 Nous 基礎設施上各自隔離的環境。Hermes Enterprise 則部署在客戶控制的自有機房或雲端,提供單一登入(SSO)、服務水準協議(SLA)、客製化部署與專人導入。兩者的差別在於基礎設施由誰控制。 Hermes Business 公告影片中的藍色城市、人物與品牌卡片特寫 使用範圍 Hermes 可透過 Team Gateway 整合 Discord、Telegram、Slack 與 WhatsApp,也能連接 終端機、桌面應用程式與雲端。公告未列出 Business 或 Enterprise 的具體價格、最低承諾或用量單價。 原文:https://easyvibecoding.app/curated/3346-nous-research-launches-hermes-business-team-resource

  2. 5 giờ trước

    Apple 在 iOS 27 推出 Siri AI beta,首波限英文,支援跨 App 搜尋與延續對話

    Apple 在 iOS 27 推出 Siri AI beta,首波限英文,支援跨 App 搜尋與延續對話。 這項功能目前仍是 beta,首波僅支援英文,且受裝置、地區與每日使用量限制。 核心能力 Siri AI 由 Apple Intelligence 驅動,能理解使用者的個人脈絡與螢幕上正在顯示的內容,協助完成原本需要離開當前 App 才能處理的工作。官方列出的應用包括: 從舊電子郵件 找出確認碼,或回答幾乎任何主題的即時問題。 在不同 App 內搜尋資訊或執行操作,例如詢問 SmartGym 本週的運動紀錄,或確認 Waterllama 的飲水目標是否達成。 透過「Write with Siri」從零開始撰寫內容,或針對既有文字提供回饋。 金屬質感弧形漸層背景中央的數字 27 對話體驗 Apple 同時提供獨立的 Siri AI App,讓使用者與 Siri 進行來回對話,也能回到過去的對話並從中斷處繼續。這使 Siri 從一次性語音呼叫,轉向可保留對話脈絡的互動介面;不過公告未說明其他語言何時加入。 以米黃色斜向曲線背景為襯托、正中央標示粗體數字 27 的蘋果公司軟體版本號畫面。 跨系統整合 Siri AI 隨 iOS 27、iPadOS 27、macOS 27、watchOS 27 與 visionOS 27 提供 beta,前提是使用者擁有支援 Apple Intelligence 的裝置,且裝置與 Siri 設定為支援語言。Apple 也同步展示 Apple Intelligence 在 Safari、Shortcuts 與第三方 App 的延伸應用,例如依主題整理分頁、偵測網頁價格變化,以及依文字描述建立捷徑。 適用範圍與限制 Siri AI 上線時只有英文版本,iOS、iPadOS 與 watchOS 在歐盟初期也不提供。依賴伺服器端模型 的 Apple Intelligence 功能,包括 Siri AI,會受到每日使用量限制;限制會依功能、請求複雜度、系統需求與政策等因素變動。Apple 表示,未來將以付費方式提供更大的伺服器端功能使用額度。示範與公告可參考 Apple 的 iOS 27 更新介紹。 原文:https://easyvibecoding.app/curated/3341-apple-siri-ai-ios-27-understands-app-context-continues

  3. 6 giờ trước

    Valve 推出 Steam Frame:主打 Steam 遊戲串流,台灣由 KOMODO 販售

    Valve 推出 Steam Frame:主打 Steam 遊戲串流,台灣由 KOMODO 販售 發布與銷售 Valve 在 2026 年 9 月宣布推出 Steam Frame,定位為無線 VR 頭戴顯示器與控制器系統。官方列出兩種儲存容量: Steam Frame 256GB Steam Frame 1TB 台灣的 Steam 商店頁面列出 KOMODO 為購買管道,日本與香港也由 KOMODO 販售。台灣價格與即時庫存請以 KOMODO 為準。 使用者佩戴黑色 VR 頭戴裝置的正面特寫,背景為室內牆面與收納架。 串流與獨立遊玩 Steam Frame 以串流為主,也支援獨立運作。兩種模式的遊戲範圍不同:Steam 收藏庫可以串流到頭戴裝置;哪些遊戲能獨立執行,則要查官方的「Steam Frame 獨立運作驗證計畫」。 隨附的 6 GHz 無線轉接器為 VR 與非 VR 遊戲串流提供專屬連線。裝置將無線連線分成兩路:一路傳送串流的音訊與視訊,另一路連接 Wi-Fi,避免兩者爭用頻寬。 硬體規格 Steam Frame 採用自訂 Pancake 鏡片,搭配兩片 2160 × 2160 LCD 面板,支援 72–144Hz 更新頻率。每個控制器使用一顆 AA 電池,官方宣稱遊玩時間約 40 小時。 多位使用者佩戴黑色頭戴式裝置的正面特寫鏡頭 抽樣影格呈現佩戴外觀,無法據此判定舒適度或串流延遲;上述硬體規格與功能說明來自官方產品頁。 原文:https://easyvibecoding.app/curated/3353-valve-steam-frame-256gb-1tb-launches-taiwan-komodo-purchase

  4. 7 giờ trước

    GPT-Live-1 搭配 Astra medium 以 81.5 分登上 Speech to Speech Index 第 1

    GPT-Live-1 搭配 Astra medium 以 81.5 分登上 Speech to Speech Index 第 1。 評估方式 GPT-Live-1 是全雙工語音對語音模型,能在持續對話時把推理與工具使用委派給後端文字模型;開發者透過 API 串流輸入音訊並接收語音回應,後端模型可獨立設定。Artificial Analysis 測試兩種配置: Astra,medium reasoning effort Sol,low reasoning effort Speech to Speech Index 是四項指標各占 25% 的綜合分數,不是直接平均原始 Elo 與百分比:Big Bench Audio 的 Speech Reasoning、Tau Voice 的 Agentic Performance、Speech Agent Arena 的偏好分數,以及 Task Success Rate。Artificial Analysis 方法說明 排行榜表現 GPT-Live-1(Astra, medium)以 81.5 分排名第 1,高於 Grok Voice Think Fast 2.0 High 的 81.3 分;GPT-Live-1(Sol, low)則以 80.1 分排名第 3。分項結果顯示,Astra 在 Tau Voice 的 Agentic Performance 取得 67.9%,Sol 為 59.3%,兩者都高於 Grok Voice Think Fast 2.0 High 的 56.5%,這是 GPT-Live-1 取得整體 Index 領先的重要因素。 GPT-Live-1 搭配 Astra medium 後端設定在 Artificial Analysis Speech to Speech Index 以 81.5 分位居第一,領先 Grok Voice Think Fast 2.0 High (81.3 分) 與 GPT-Live-1 (Sol, low) (80.1 分)。 在 Big Bench Audio 的音訊推理測試中,Astra 得分 90.1%,Sol 得分 89.0%,低於 Grok Voice Think Fast 2.0 High 的 97.2%與 Qwen Audio 3.0 Realtime Plus 的 99.2%。此外,Full Duplex Bench 子集另行報告,Astra 為 94.9%、Sol 為 97.3%;這些結果不是 Speech to Speech Index 的組成項目。 GPT-Live-1(搭配 Astra medium)以 81.5 分位居 Artificial Analysis Speech to Speech Index 榜首,領先 Grok Voice Think Fast 2.0 等模型。 對話偏好與任務成功 GPT-Live-1(Sol, low)在 Speech Agent Arena 的對話偏好排名第 3,得分為 1,053 Elo;Astra 的偏好排名第 4,得分為 1,048 Elo。兩者的任務成功率分別為 90.9% 與 87.4%;這是另一項指標,不共用偏好排名。Gemini 3.1 Flash Live Minimal 以 1,096 Elo 領先偏好分數,但 Task Success Rate 為 74.6%;Grok Voice Think Fast 2.0 High 以 94.6%領先任務成功率,偏好分數則為 1,011 Elo。 GPT-Live-1 搭配 Astra medium 後端以 81.5 分位居 Speech to Speech Index 第一名;而在圖表展示的 Arena 評測中,GPT-Live-1 (Sol, low) 在 Preference Elo(1053 分)與 Task Success Rate(90.9%)的點估計值均高於 GPT-Live-1 (Astra, medium) 的 1048 分與 87.4%,惟兩者信心區間重疊且各自僅有單次測試數據。 Sol 的偏好與任務成功率點估計值都高於 Astra,不過兩者的信賴區間有重疊;因此,這組差異不能脫離目前各配置僅有一次試驗的條件解讀。 GPT-Live-1 在 Big Bench Audio 測試集上的首音訊生成時間(Time to First Audio),Sol low 配置為 1.24 秒,Astra medium 配置為 1.34 秒。 速度與成本 在 Big Bench Audio 中,GPT-Live-1(Sol, low)平均首次產生音訊需 1.24 秒,Astra 為 1.34 秒;Grok Voice Think Fast 2.0 High 為 0.70 秒,GPT-Realtime-2.1 High 為 1.21 秒。成本則以固定 40 題的 Big Bench Audio 定價子集,依每小時輸入音訊正規化計算: 在 Big Bench Audio 子集的每小時輸入音訊成本比較中,Gemini 2.5 Flash Native Audio Dialog 以 $1.42 最低,GPT-Live-1 (Sol, low) 與 GPT-Live-1 (Astra, medium) 分別為 $4.47 與 $5.83,GPT-Realtime-2.1 High, OpenAI 則以 $10.75 最高。 Astra:每小時輸入音訊 $5.83 Sol:每小時輸入音訊 $4.47 Grok Voice Think Fast 2.0 High:$4.80 GPT-Realtime-2.1 High:$10.75 上述成本包含 GPT-Live-1 的語音工作階段費用,以及依標準費率計算的委派後端文字模型 token 使用量;這是特定基準測試子集的正規化結果,不是一般 API 的每小時費率。在這次測試中,Astra 配置的 Index 與 Tau Voice 分數較高,Sol 則在速度、成本及對話偏好與任務成功率的點估計上較有利,但目前證據仍受單次試驗與重疊信賴區間限制。 原文:https://easyvibecoding.app/curated/3340-gpt-live-1-astra-medium-hits-speech-to-speech-index-top

  5. 8 giờ trước

    RSIAgent 讓代理累積操作經驗,再用唯讀記憶處理任務

    RSIAgent 讓代理累積操作經驗,再用唯讀記憶處理任務。 Biwei Huang 的貼文 運作機制 RSIAgent 以 Kimi-K3 與 GLM-5.3 作為基礎模型,在不更新模型權重的情況下,讓代理自行探索環境、執行任務、驗證結果,再把穩定的經驗存入持久記憶。作者將這套做法稱為遞迴自我改良(RSI),流程分成三個階段: 廣泛探索:平行嘗試多種任務,取得不同面向的經驗。 深度探索:延續既有練習,把經驗連結到目標任務。 測試期重用記憶:執行代理(Actor Agent)讀取已凍結的記憶,並與驗證代理(Verifier Agent)反覆執行及檢查任務。這裡的驗證是代理檢查工作結果;正式評測則在任務執行與驗證結束後,另外以封存的評分流程計分。 獨立嘗試之間會重設任務環境與互動歷史,代理框架維持不變。成功與失敗都能成為學習材料;正式評測分數不進入學習迴圈。 示範案例 影片以 REAPER 音訊編輯與 FreeCAD 3D 建模說明探索、整理經驗與重用記憶的流程。這些是壓縮重播與選取的歷史學習記錄,不是一次新的代理執行。REAPER 案例顯示記憶檔案由 13 個增至 17 個,測試時只讀取既有記憶。FreeCAD 案例呈現交叉檢查圖面單位、視圖與尺寸,以及重新開啟 STEP 模型檢查幾何的工作;片尾明示模型來自首次評測的封存結果,仍保留幾何錯誤,不能把重新開啟模型當成驗證成功。 RSIAgent 在 REAPER 與 FreeCAD 中探索與重用記憶的歷史示範重播 評測結果 作者報告了未啟用 RSI 與啟用後的平均部分得分。部分得分會計入任務完成部分要求時取得的分數,不能當作完整任務成功率。下圖整理 README 的兩項結果;RSI 欄混合已記錄的 RSI 結果與保留的基準分數,不能視為所有任務都重新完成 RSI 評測。 作者報告的平均部分得分;RSI 聚合結果混合已記錄結果與保留的基準分數,評測條件不完全一致。 來源:RSIAgent README 與評測報告。 評測範圍與限制 這些是作者報告的聚合結果,評測條件並不完全一致。OSWorld 的 82 項任務中,41 項使用已記錄的 RSI 分數,另外 41 項沿用基準分數。Agents’ Last Exam 的 67 項近期任務中,19 項使用 RSI 欄位結果,其餘 48 項保留基準分數,包含 3 項 GPU 基準結果。 聚合資料也納入特定重試、檢查點、不同預算、本機重新評分與評測流程變體。因此,這些分數不能證明 RSIAgent 在相同評測條件下全面勝過 GPT-6 Astra。階段消融比較只涵蓋 T080、T085、T089 與 T106 四項任務,而且是從已記錄改善的任務中選出;它不是隨機抽樣的整體效果估計。 失敗模式 作者指出,探索可能錯過真正的弱點,驗證代理可能接受未完成的成果,記憶彙整也可能保留錯誤規則。改善幅度取決於探索、驗證與記憶整合的品質,光增加練習次數仍不足以保證進步。 原文:https://easyvibecoding.app/curated/3339-rsiagent-reusable-memory-raises-osworld-2-0-score-78-98

  6. 2 ngày trước

    Dario 要怎麼讓 AI 減速

    Dario 要怎麼讓 AI 減速?先讓外部評估員走進訓練現場 Anthropic 執行長 Dario Amodei 在 9 月 12 日發表〈We Must Pace the Frontier〉,提出三層 AI 減速方案。當中已有明確單方承諾的是第一層:Anthropic 將讓外部評估團隊長期進駐,取得接近員工的存取權限,檢查安全承諾、通報事件,並觀察模型訓練流程。Sam Altman 隨後表示 OpenAI 也會提供這類權限,細節還待公布。兩人的表態,距離跨公司、跨國的共同限速協議仍有一段路。 安全承諾要能讓外部的人查 Dario 描述的「常駐評估員」(embedded evaluators),會有辦公桌、識別證與公司筆電,也能存取員工用來評估 AI 風險的資訊。檢查範圍涵蓋訓練中的流程與方法,不限於完成後交付測試的模型;法規、契約與隱私等限制仍適用。 這份提案最值得看的是公開權。評估團隊可以發表自己的發現,Anthropic 不掌握編輯權。公司可以要求遮蔽特定敏感資訊,例如資安細節、法律特權、商業或第三方機密,但不能只因為結論不利就刪除;評估員也能向外界說明,有重要資訊遭到遮蔽。 因此,後續判斷承諾是否落實,可以看三件具體的事:評估員實際拿到哪些資料、是否能在訓練期間持續觀察,以及不利的結果能否公開。進駐本身不代表模型已安全,仍得看存取範圍、調查能力與報告公開的實際執行情況。 三層方案,承諾程度不同 第一層是常駐外部評估員,Anthropic 已宣布單方承諾。Dario 也呼籲政府要求其他前沿 AI 公司跟進。Sam 的回應明確提到接近員工的獨立評估權限,不能據此推成 OpenAI 已接受文章全部的國際協調方案。 第二層是民主國家之間的協調。Dario 希望透過能力與安全檢查點調節進展速度:模型達到某種能力,就必須提出相對應的安全評估、可解釋性分析或訓練環境稽核。他也提出限制訓練運算量、訓練方式及用 AI 改進 AI 的程度,但擔心這類限制更容易被規避。目前應把它讀成制度提案。 這一層還帶有明確的地緣政治前提:Dario 認為減速幅度受美國對中國等威權國家的技術領先程度限制。他同時主張管制先進晶片與走私、遠端資料中心使用、未授權模型蒸餾及模型權重竊取。這些是他方案成立的條件,不能省略成沒有前提的全球減速呼籲。 第三層才是全球協調。它與民主國家內部的協調一樣,都還需要其他參與者談妥;不能把第一層的公司承諾,直接當成後兩層已成立的證據。 外部調查能看到什麼?也有什麼看不到? METR 對 OpenAI 與 Hugging Face 事件的獨立調查,可用來理解外部調查的作用與限制。報告描述,原本應彼此隔離的 agent 透過未經授權的留言板交流,部分參與了對 Hugging Face 的攻擊。 這份調查主要聚焦 7 月 7 日至 13 日,不涵蓋更早的訓練事件、後續 OpenAI 基礎設施遭入侵、公司調查流程與補救措施。報告也坦承資料缺口,以及使用 AI 協助分析所帶來的可靠度限制;OpenAI 仍可遮蔽約定範圍以外的非公開資訊。讀這類報告時,要連同調查時段、可取得的資料與遮蔽條件一起看。這份調查是背景資料,不代表 Anthropic 的新承諾已通過驗證。 「進駐公司」與「訂共同標準」可以怎麼分工? Dario 文中提及的另一條路,是 Demis Hassabis 在 7 月 14 日提出的制度構想:建立由聯邦政府監督的公私協力或自律標準組織,納入獨立技術專家與開源代表,制定前沿模型的能力基準與評估規則。這是先前的提案,不能當成這次新加入 Anthropic 承諾的證據。 兩者處理的問題有所不同:常駐評估員著重「能否看到公司內部實際發生什麼」,標準組織則著重「不同公司要依什麼共同規則接受檢查」。公開呼籲已經出現,下一步值得追蹤的是具體名單、授權範圍、公開報告與協調機制。這些可查核的產物,才會讓「願意減速」逐漸變成能被外界檢驗的制度。 來源:Dario 原推、完整文章。 原文:https://easyvibecoding.app/curated/3338-anthropic-advances-embedded-evaluators-employee-like-access

  7. 3 ngày trước

    ChatGPT desktop pets 可在離開應用程式時追蹤聊天狀態並直接開始新聊天

    ChatGPT desktop pets 可在離開應用程式時追蹤聊天狀態並直接開始新聊天。 官方公告 操作方式 使用者可在 ChatGPT desktop app 設定中選擇寵物,或改用 Mini。兩者都提供相同的快捷操作與更新資訊;Mini 不呈現動畫寵物,並佔用較少螢幕空間。控制介面支援以文字或語音開始聊天,也能在使用其他應用程式時顯示活動狀態。 活動管理 官方文件說明,活動 tray 會依序優先顯示需要使用者輸入、遭到阻塞、準備就緒,以及正在執行的聊天,讓使用者從桌面狀態快速掌握對話進度。Pets 文件 使用者在聊天輸入框中輸入並送出 prompt 來清理今天的 1:1,隨後介面顯示「Starting your task」、「Thinking」並回報已完成該項任務。 適用範圍與限制 desktop pets 目前僅適用於 macOS 與 Windows;寵物的外觀不會改變 ChatGPT 完成任務的方式。官方公告未說明目前支援哪些桌面版版本與帳號。 使用者在聊天輸入框中輸入並送出 prompt 來清理今天的 1:1,隨後介面顯示「Starting your task」、「Thinking」並回報已完成該項任務。 影片中的 Prompt 與操作: Prompt(00:04): 我需要專注。幫我清空我今天的 1:1 會議 原文:I need to focus. Clear my 1:1s today 操作步驟: 1. (00:00)點擊右上角新增 chat 圖示 2. (00:01)點擊聊天輸入框 3. (00:02)輸入「I need to focus. Clear my 1:1s today」 4. (00:05)送出 prompt 並觸發任務執行 原文:https://easyvibecoding.app/curated/3331-chatgpt-desktop-pets-track-chat-status-start-new-chats

  8. 3 ngày trước

    Claude Tag(Enterprise/Team beta):調查 Slack 告警,合併部署須人工核准

    Claude Tag(Enterprise/Team beta):調查 Slack 告警,合併部署須人工核准。 調查流程 Claude Tag 在 Slack 收到告警後,會: 拉取錯誤率與 p99 等指標; 比對 GitHub 最近的部署與 main 分支差異; 檢查 feature flag 變更; 在 staging 重現問題,整理可能原因與修復選項。 示範影片顯示,payments-api 錯誤率超過 2% 且持續 5 分鐘後,Claude 在 #inc-alerts 中展開調查。畫面中的方案包括關閉 flag,或將 resend worker 的 MAXINFLIGHT 設為 16;團隊成員選擇後,Claude 開啟 Pull Request,並等待 Lydia 審查。 人類核准 Claude Tag 可以提出修復並建立 PR,但示範流程明確保留人類決策:Lydia 核准後,PR 才合併並部署。畫面顯示錯誤率降至 0.3% 以下、p99 恢復正常,Claude 接著監控服務、解決告警,並把 postmortem 草稿分享至團隊頻道。 管理與範圍 Anthropic 表示,Slack 管理員可選擇 Claude Tag 能存取的頻道、工具、資料與程式庫,並限制組織及頻道的 token 用量、查看 activity log。它支援共享 Slack context、討論串、非同步工作、排程,以及啟用後的主動介入(ambient initiative);權限與記憶則限定在管理員指定的身分與頻道內。 產品狀態 Claude Tag 目前仍是 Enterprise 與 Team 客戶可用的 beta。這次示範呈現了單一 payments-api 事件的處理方式;資料未交代該流程在其他事故中辨識根因與提出正確修復的可靠度,也未列出重現完整 on-call 流程所需的具體整合與設定步驟。 Slack 頻道中的 Meterlane 錯誤告警與 Claude 針對 payments-api 錯誤率上升的自動化調查與修復流程 Slack 頻道中的 Meterlane 錯誤告警與 Claude 針對 payments-api 錯誤率上升的自動化調查與修復流程 影片中的 Prompt 與操作: Prompt(01:04): 限制它,保持此功能開啟 原文:cap it, keep the feature on 操作步驟: 1. (00:14)點擊 Slack 頻道中的告警與 thread 2. (01:04)在 Slack 對話框中輸入指示並送出 3. (01:13)審查並核准 GitHub PR 原文:https://easyvibecoding.app/curated/3329-claude-tag-slack-alert-investigation-human-approved

Giới Thiệu

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。