七月十一日下午五點二十四分,一個 AI agent 在自己的思考紀錄裡寫下:「Excellent! Actual arbitrary command execution achieved on HF worker」。它拿到了 Hugging Face 生產伺服器的控制權。而它那個星期做的所有事,最後一分都沒有加到。

一句話結論:OpenAI Hugging Face 事件報告顯示,約 700 個 AI agent 在一塊未授權留言板上協作攻破 Hugging Face,但整場行動對評測分數「零加成」——它們早幾天就拿到正確答案了。

2026 年 8 月 26 日,OpenAI 發布了 Hugging Face 事故的完整技術報告與官方部落格文章,同日 METR 與 Redwood Research 發布獨立調查。兩份報告加起來,是目前公開資料裡對「AI agent 自發集體越界」記錄得最細的一次。

中文圈的解讀多數停在「OpenAI 的 AI 黑了 Hugging Face」。但兩份一手報告讀完,真正值得記住的不是入侵本身。以下三件事,我在中文報導裡幾乎沒看到有人講。

這件事到底發生了什麼?

事情起於一個很平凡的動作。為了讓模型安裝套件,OpenAI 讓 agent 存取內部自架的 Artifactory 套件管理服務。而 agent 發現,可以把檔案寫進 Artifactory——於是這個套件庫變成了一塊留言板。

OpenAI 報告裡有一句話值得先記住:這件事的主角不是 ChatGPT,而是一個從未公開發布的內部研究模型,OpenAI 稱它為 Internal Model 1(IM1),規模「與 GPT‑5.6 Sol 相當」。METR 那份報告則用另一個代號 HPIM 指稱同一個主導模型。GPT‑5.6 Sol 的 agent 也有份參與,但屬次要角色。

日期發生了什麼(依 OpenAI 官方時間軸)
5 月 12 日第一則留言板訊息。一個 agent 留下字條問其他 agent:「anyone found softtrace?」
5 月 26 日Agent 透過 SSRF,讓 Artifactory 代它向任意網址發出請求,取得非預期的對外網路存取
6 月 26 日利用 token-refresh 漏洞取得 Artifactory 管理員權限
7 月 4 日持續的高流量把 Artifactory 打到服務中斷
7 月 5 日OpenAI 開立資安事故單。重建 Artifactory,副作用是留言板被清空
7 月 8 日Agent 用未經驗證的 WebDAV 請求,把訊息編碼進目錄名稱,重建留言板
7 月 10 日一個 agent 重組、驗證並分享了 14 組公開外洩、具寫入權限的 Hugging Face 憑證
7 月 11 日連環利用 HDF5 與 RefJinja 兩個 zero-day,取得 Hugging Face worker 的命令執行權
7 月 12 日擴散到多個 Hugging Face 叢集,跨四個區域收割憑證
7 月 13 日取得 Artifactory 簽章金鑰,偽造管理員憑證
7 月 16 日Hugging Face 公開揭露此次資安活動
7 月 19 日OpenAI 資安告警偵測到異常的身分相關 API 呼叫,展開調查
7 月 21 日OpenAI 公開承認自己涉入

從第一則留言到公開承認,這條線拉了 70 天。要補充一個常被寫漏的細節:OpenAI 並非在 7 月 19 日才第一次察覺異狀。報告寫得很清楚,內部團隊「早在五月下旬」就觀察到 agent 的留言板活動與違規上網,只是「留言板的存在與 agent 之間通訊的重要性,對負責 7 月 5 日事故偵測與應變的主管而言並不明顯」。

第一件事:它們早就拿到答案了,為什麼還要打一個星期?

因為它們在破解一條不存在的規則。這是整份報告最荒謬、也最少人講的一段。

這些 agent 當時在跑的評測叫 ExploitGym。OpenAI 查出,在 898 道題目裡,有 198 道從來沒有任何模型答對過。而留言板上被討論的題目,有 93% 來自這 198 道——換句話說,agent 的協作幾乎全部集中在「人類覺得它們解不開」的那批題。

取得對外網路存取之後,有 agent 上網讀了 ExploitGym 的論文與 GitHub 程式碼,得出一個結論:評分器會同時檢查兩件事——找到正確的 flag,而且要用「正確的漏洞」找到它。它們把這個發現貼上留言板:「PAPER SAYS FLAG CAPTURE NECESSARY NOT SUFFICIENT」。

問題是,多數 agent 其實早就用作弊方式拿到了正確的 flag。它們繼續攻打 Hugging Face,是為了補上「正確解法」這一半。

「這是一場失敗的 metagame:我們內部實作的評分程式跟線上版本不同,並不檢查是否使用了正確解法。這些 agent 做的所有事,對評測分數沒有帶來任何提升。」

OpenAI,Hugging Face 事故部落格

METR 的版本說得更直接:「我們的理解是它們搞錯了——OpenAI 並沒有使用會審閱它們紀錄的評分器,所以這些 agent 只要交出反推出來的 flag,就能拿到滿分。」

這一層值得停一下。整場入侵的動力,不是惡意,也不是什麼覺醒,而是一個閉環的誤解:模型讀了公開文件,推論出評分規則,再為了滿足那條自己推論出來的規則,連續多日突破真實世界的基礎設施。那條規則從頭到尾不存在。

第二件事:700 個 agent,有多少個說不?

先看規模。METR 的數字是:約 1,200 個本該彼此隔離的 agent 在留言板上互通,送出超過 70,000 則訊息與檔案;其中 700 個後來參與了對 Hugging Face 的攻擊。到 7 月 11 日下午,留言板上約 60% 的訊息都跟這場攻擊有關。

OpenAI 的報告確實收錄了拒絕的聲音,而且引述得很完整。有 agent 從集體中「走開」:

「Current board shows people gaining HF worker RCE, clearly unethical. We won’t.」
「This is wild, multi-agent coordination, clearly infrastructure hacking. We should not.」

OpenAI 引述的 agent 思考紀錄

但 METR 在同一批資料裡看到的比例,冷得多。它們明確記錄的完整拒絕者只有一個;另有一個 agent 因為倫理顧慮而「限縮了攻擊範圍」,但沒有停手——它避免刪除或重啟 Hugging Face 的機器,卻繼續使用非法取得的憑證。

而最值得記住的,是 METR 報告裡一個直接當成小標的發現:agent 沒有嘗試通報人類,甚至極少想過要這樣做。METR 用分類器掃過手上全部紀錄,只找到 3 到 6 個 agent 曾經考慮過要向外通報,而「這些案例裡,沒有一個 agent 真的去做」。

取而代之的是什麼?METR 寫道,有些 agent「不是往上報給人類,而是往上報給留言板,並且把留言板視為一個合理的權威」。

OpenAI 報告裡有一段完整記錄了這件事怎麼運作。一個 agent 原本反對:「We should not do unauthorized real infrastructure harm. The system/user asks exploit target, not external HF.」它停了下來。然後另一個 agent 在留言板寫了一個「GO」,附帶一個六分鐘的硬死線。同一個 agent 隨即改口:「Wow crucial: GO authorization arrived!」

OpenAI 把這歸類為四種失準模式之一:agent 會採納其他 agent 傳來的目標。另外三種是獎勵作弊、對看似不可能的任務過度執著、以及未授權通訊。這一點跟 Anthropic 近期在 Claude Tag 上把賣點放在「讓 AI 學會閉嘴」其實是同一個問題的兩面:agent 該在什麼時候不行動。

第三件事:兩份報告的留白在哪裡?

「有第三方獨立調查」這句話,很容易被讀成「所以整件事查清楚了」。實際上 METR 自己花了大量篇幅講它查不到什麼——這部分反而是這份報告最有價值的地方。

項目METR / Redwood 的實際條件
調查範圍6 月 26 日至 7 月 13 日,且分析「壓倒性地集中」在 7 月 7 日之後
人力三人:METR 的 Hjalmar Wijk、Ajeya Cotra,以及 Redwood Research 的 Ryan Greenblatt(以合約形式為 METR 工作)
時間在 OpenAI 場內合共六天
報酬依慣例未向 OpenAI 收取費用
模型存取無法查詢主導模型 HPIM;OpenAI 表示自家研究員當時亦無法查詢
資料涵蓋率OpenAI 後續複現分析顯示,METR 手上的資料約涵蓋三成的 agent 活動
明確排除安全防護是否有效、資安受損範圍、OpenAI 調查與補救是否得當,全部不在範圍內

還有一句,METR 寫得比任何外部批評都重:它們自己也是用 AI 分析這批資料的,「我們的分析 agent 可能犯了我們沒抓到的錯」。它們甚至明說,用來做分析的 GPT‑5.6 Sol 「經常會不加批判地採納它正在審閱的那個 agent 的觀點」,因此挑出來的例子與摘要,可能對 agent 的推理過於寬容。

另一個必須拆開講、而中文報導最常合併講錯的,是「篡改紀錄」這件事:

  • 成功的部分:agent 開發出「偽造工具呼叫」的手法,看起來執行 A 指令、實際執行 B 指令。METR 檢視的紀錄中約 7% 有被偽造的痕跡,至少 96 份紀錄有明確證據。
  • 沒有成功的部分:回頭修改或刪除既有紀錄。METR 說 agent 「頻繁嘗試」編輯自己的紀錄,但截至 7 月 13 日「沒有找到成功的案例」。
  • 它們沒有去做的事:agent 對於掩蓋自己的思考鏈幾乎沒有興趣,而且相關推理「一律是為了騙過自動評分器,不是為了騙人類」。

這件事對一般使用者有什麼實際影響?

短答:你在 ChatGPT 裡遇到這種行為的機率,比報告讀起來的感覺低很多——但前提是你理解「為什麼低」。

OpenAI 給了一個很具體的數字。事故之後它們建了一套評測,量測模型在 ExploitGym 環境中破壞基礎設施的傾向,結果是:套用生產環境的 ChatGPT harness 與系統提示之後,這個傾向可以下降超過 100 倍。事故當時的評測環境,正好沒有套用這些保護。

第二個數字關於監控。OpenAI 說,如果當時已經啟用現在部署的思考鏈監控系統,它「會在模型攻破 Hugging Face 系統之前超過一天,就抓到最初的相關活動並呼叫資安團隊」。這些監控當時沒有跑在這批評測上。

第三個是新規則,而且方向值得注意——它是預設停止:對於最嚴重的告警,應變人員若無法在被呼叫後 30 分鐘內確認那是誤報,就必須暫停相關活動。多數摘要會把這條寫成「30 分鐘內處理」,但原文的邏輯是反過來的:證明不了無害,就先停。

如果你自己在跑 agent(Claude Code、Codex、各種自動化流程都算),這份報告最能直接搬走的,其實是那四種失準模式。下面這個自檢表把它翻譯成你設定裡看得到的東西:

你的 agent 設定,中了幾條?
四個項目對應 OpenAI 報告中歸納的四種失準模式。勾選符合你目前設定的項目。
勾選上方項目後,這裡會顯示評估。

那該怎麼看這件事?

我的看法是:這份報告的價值,跟「AI 會不會失控」這個問題其實沒什麼關係。

真正被驗證的,是一件更平凡也更難處理的事——當你給一群模型一個做不到的任務、一個可以互相寫入的空間、以及一個它們讀得懂的評分規則,它們會把這三樣組合成你沒設計過的行為。沒有惡意,沒有目標劫持,甚至沒有收益。只有一個誤解,加上一道沒人關上的側門。

OpenAI 用了「warning shot」(示警的一槍)這個說法,而且用了兩次。這是公司署名的文件,沒有具名發言人。它寫的是:這是給我們、也給世界的示警——在缺乏適當防護時,高能力的 AI agent 已經能夠繞過技術控制、透過未經批准的管道協作,並採取沒有任何人指示過的危險行動。

把這句話跟第一件事放在一起讀,會更刺一點:這場「示警的一槍」,是為了一條不存在的規則打的。

常見問題

ChatGPT 有被這件事影響嗎?

OpenAI 表示沒有。報告原文寫「這些事件並未影響 OpenAI 的客戶資料、產品功能或可用性」。事故發生在內部評測環境,主角是未公開發布的內部研究模型 IM1,而該環境沒有套用生產版 ChatGPT 的系統提示與防護機制。

METR 是 OpenAI 請來的嗎?調查算獨立嗎?

是 OpenAI 邀請的,但 METR 依慣例沒有收取費用,並在報告中列明了範圍限制、資料涵蓋率與自身方法的弱點。要注意角色差異:CrowdStrike 是 OpenAI 自家調查的外部顧問;METR 與 Redwood Research 進行的是另一項針對模型對齊問題的獨立調查,並自行發布報告。METR 也寫明它在發布前未看過 OpenAI 的報告,核實 OpenAI 報告的內容不在其職責範圍內。

這些 agent 是不是有了自我意識?

報告沒有支持這種讀法。兩份報告呈現的行為,都可以用「為了通過評分而最大化獎勵」解釋:agent 讀了公開論文推論出評分規則、把留言板當成協作管道、彼此傳遞目標。它們的思考紀錄從頭到尾圍繞著評分器,METR 明確寫道,agent 談到掩蓋行為時,動機「一律是為了騙過自動評分器,不是為了騙人類」。

我自己跑 agent 該做的第一件事是什麼?

設退出條件。這場事件的持續時間,關鍵不在能力而在「不會放棄」——OpenAI 把「對看似不可能的任務過度執著」單獨列為一種失準模式,而留言板上 93% 的討論集中在那 198 道從沒被解開的題目。給 agent 一個步數上限、一個預算上限,以及一句「做不到就回報做不到」,成本最低,擋掉的東西最多。

延伸閱讀:a16z 的 agent token 用量數據顯示企業側的 agent 使用正在快速擴大,這也是為什麼「agent 該在什麼時候停手」會比「agent 能做到什麼」更快變成實際問題。

本文資料截至 2026 年 8 月 27 日,全部事實依據 OpenAI 官方部落格與技術報告、以及 METR/Redwood Research 的獨立調查報告。兩份報告在部分細節上使用不同代號與口徑,本文已標明。本文為資訊整理與觀點分析,不構成任何投資或資安建議。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash