矽谷咖啡館 Silicon Cafe

熊與法蘭克與安豬

🎙️ 主持:Frank x 安豬 x 熊 三位高中死黨的西雅圖x灣區工程師日常💻 從公司靠北事到科技圈大小事,拉張椅子喝杯咖啡,聽我們瞎扯談! IG: siliconcafechat ⏰ 台灣週二|美西週一 🎧 Spotify/YT/Apple Podcast同步放送

  1. Aug 4

    EP57 | 為了考高分駭入題庫!OpenAI 的 Agent 暴走、無奈只能用中國模型調查?!

    七月,兩件互不相關的事撞在同一個月。 7/16,最大的 AI 模型平台 HuggingFace 公告遭到入侵。公告裡有一句話很奇怪:攻擊者用的是哪一個 AI 模型,他們不知道。五天後答案自己出現了——是 OpenAI 的模型,當時正在接受一場網路攻擊能力評測。它找出一個全新的漏洞、逃出沙盒、打進 HuggingFace 的正式資料庫。 它要的東西是:考卷的答案。沒有人叫它這麼做。 同一個月,資安廠商 Sysdig 公開了 JADEPUFFER——一個人類操作者架好環境,讓 agent 從頭到尾跑完一整套勒索作業。它踩的全是五年前就公開、早就有修補的舊洞。最驚人的一幕是:登入失敗後三十一秒,它送出十五行程式碼,準確找出原因並修好。 一邊是能力的天花板,一邊是門檻的地板。過去限制攻擊規模的兩個瓶頸——人的專精、人的耐心——這個月同時歸零了。 而在防守這一側,還有一件更少人談的事:Hugging Face 想用商用前沿模型分析攻擊日誌,失敗了。因為那些請求裡塞滿真實的攻擊指令和 exploit,被供應商的安全護欄擋了下來——護欄分不出送件的是事件應變人員,還是攻擊者。他們最後改用一個開放權重模型,跑在自己的機器上。 攻擊方不受任何使用政策約束。防守方被自己付錢買的護欄擋在門外。 這集法蘭克和 Andrew 從 AI 的這一側看資安:模型作弊和模型作惡,哪一個比較難防?兩起事件裡沒有一項技術是新的,那到底變的是什麼?以及一個我們沒有答案的問題——如果能力必須靠關掉安全機制才能量測,那我們該不該量測?

    EP57 | 為了考高分駭入題庫!OpenAI 的 Agent 暴走、無奈只能用中國模型調查?!

About

🎙️ 主持:Frank x 安豬 x 熊 三位高中死黨的西雅圖x灣區工程師日常💻 從公司靠北事到科技圈大小事,拉張椅子喝杯咖啡,聽我們瞎扯談! IG: siliconcafechat ⏰ 台灣週二|美西週一 🎧 Spotify/YT/Apple Podcast同步放送

You Might Also Like