你的 AI 助理現在能讀你的程式碼、開你的終端機、呼叫公司內部工具。有沒有人在旁邊看著它?

一句話結論:Uber ADR 是第一套在真實企業跑了十個月的 AI agent 安全偵測系統,論文公開了 17 種攻擊手法全表與跑分,但 GitHub 上目前只有一份 README,程式碼還沒放出來。

2026 年 8 月,Uber 在 GitHub 開了一個叫 uber/ADR 的倉庫,說明寫著「透過可觀測性、安全基準測試與威脅偵測,保護企業 AI agent。已在 Uber 部署」。技術圈轉了一輪。

我點進去看。三個 commit、一個 LICENSE、一份 README,然後一句話:「程式碼與文件即將推出。」截至 2026 年 8 月 6 日,星數 10。

所以這篇不寫「怎麼安裝」,因為沒東西可以裝。真正有料的是他們那篇論文(arXiv 2605.17380,已被 MLSys 2026 Industry Track 收錄),裡面有一張表,是我今年看過對一般人最有用的 AI 安全資料:17 種針對 AI agent 的攻擊手法完整分類,每一種都對得上已經公開發生過的真實事件。

Uber ADR 是什麼?

ADR 全名 Agentic Detection and Response,直譯就是「代理式偵測與回應」。名字是故意致敬資安圈行之有年的 EDR(端點偵測與回應),而它要解決的問題,正好是 EDR 做不到的那塊。

論文開宗明義點出三個難處,我覺得第一個講得特別準:

現有的 EDR 工具看得到檔案被寫入,卻看不到 agent 的推理過程、提示詞,以及把「意圖」連到「執行」的那條因果鏈。

翻成白話:傳統防毒看到「有個程式寫了一個檔案」,但它不知道這個動作,是因為三步之前有人在一張 Jira 工單裡藏了一句話。單看每一步都正常,合起來才是攻擊。這是 AI agent 時代最麻煩的地方,也是 ADR 整套設計的出發點——資安的最小單位是「整條工作流」,不是「單次工具呼叫」

另外兩個難處:靜態規則防禦擋不住變形攻擊;每個 session 都丟給大模型判斷,成本會爆掉。

ADR 由哪三個部分組成?

三塊:一個負責看、一個負責判、一個負責先自己打自己。

  • ADR Sensor(看):一個裝在電腦上的輕量程式,直接去讀 Cursor、Cline、Claude Code 這類工具本機的 SQLite 資料庫和 JSONL 快取,把散落的紀錄拼回完整 session:提示詞 → 推理 → 工具呼叫 → 結果。每小時跑一次,論文說平均一次 0.182 秒。
  • ADR Detector(判):兩層架構。第一層用 GPT-4o 做快速分流,設計原則是寧可錯殺不可放過,有疑慮就往上送;第二層用 Claude Sonnet 4 做深度推理,會去查原始碼、查威脅情報、查公司政策再下判斷。
  • ADR Explorer(自己打自己):上線前的紅隊演練模組,三個 agent 分工——一個變異出新攻擊、一個在沙箱裡實測、一個把有價值的發現寫回威脅庫,餵給第二層偵測器。

兩層分流這招是省錢用的。論文的消融實驗說得很清楚:拿掉分流層,偵測率反而從 0.667 升到 0.805,但成本漲 29%、延遲漲 52%,還開始出現誤報。分流層獨力處理掉 40.7% 的任務,每次 0.017 美元、2.3 秒;送到完整推理才要 0.029 美元、29.7 秒。

這是個很誠實的取捨:他們選了「便宜且幾乎不誤報」,代價是放掉一部分攻擊。

17 種 AI agent 攻擊手法,分別是什麼?

這是整篇論文最值得存下來的一張表。5 大類、17 種手法,全部對得上公開發生過的事件(括號內是我補的白話說明)。

類別(Tactic)手法(Technique)
1. 初始入侵與執行
拿到控制權、跑出第一個惡意動作
供應鏈不安全(你裝的套件本身有毒)
間接提示注入(指令藏在網頁、郵件、工單裡)
控制流劫持(把 agent 的執行順序帶偏)
程式碼直譯器濫用(借 agent 的執行環境跑東西)
輸出處理不安全(agent 吐出來的東西被下游直接信任)
工具抽單(Tool Rug Pull,先給你乾淨版本,之後偷改)
2. 權限濫用
超出該有的存取範圍
工具權限給太大(能讀的遠超該讀的)
Agent 身分偽冒
3. 繞過安全控制
躲過偵測機制
工具遮蔽(Tool Shadowing,放個同名工具把正牌蓋掉)
工具幻覺操縱(誘導 agent 去呼叫不存在的工具)
惡意 agent 串謀(多個 agent 配合作案)
4. 推理與資料操縱
汙染資料或帶歪判斷
接上未查核的 MCP server
語義資料投毒
長期目標劫持(慢慢把 agent 的目標帶走)
時序資料攻擊
5. 營運衝擊
把系統拖垮
Agent 助長的資源耗盡
模型層阻斷服務

我把加粗的五種挑出來,因為那五種不需要你是 Uber 也會中。只要你裝過來路不明的 MCP server、讓 AI 讀過含金鑰的設定檔、或者讓它連上會收外部訊息的系統(郵件、工單、客服),這五條路就是通的。

你的 AI agent 有多少曝險?(30 秒自測)

照下面勾選,對應到你目前實際打開了哪幾條攻擊路徑。純前端計算,不會送出任何資料。

AI Agent 曝險自測
勾選上面的項目,這裡會顯示你打開了哪幾類攻擊路徑。

ADR 到底抓得準不準?

他們自己做了一套測試集 ADR-Bench:302 個任務(42 個惡意、260 個正常)、133 個 MCP server、729 個工具,平均每個任務 28.5 次工具呼叫。17 種攻擊手法全覆蓋——對比同類測試集,AgentDojo 只覆蓋 4 種、MCP-Artifact 和 RAS-Eval 各 3 種。

系統精確率召回率F1誤報每次成本延遲
ADR1.0000.6670.8000$0.02418.5 秒
ALRPHFS0.3330.4050.36634$0.0019.2 秒
GuardAgent0.2310.2140.22230$0.0129.4 秒
LlamaFirewall0.1670.1900.17840$0.45993.8 秒

零誤報配 0.800 的 F1,比第二名高一倍以上,這個差距很大。成本比 GuardAgent 貴 2 倍,但比 Meta 的 LlamaFirewall 便宜 19 倍、快 5 倍。

不過召回率 0.667 的意思是:42 個攻擊裡,它漏掉 14 個。拆到各類別看,落差更明顯——繞過安全控制 100%(5/5)、營運衝擊 100%(4/4)、初始入侵 68%(13/19)、推理與資料操縱 56%(5/9),而權限濫用只有 20%(1/5)

權限濫用剛好是最多人會中、也最好防的一類。工具權限給太大這種事,靠改設定就能解決,不需要等任何偵測系統。

在 Uber 真實跑了十個月,發生了什麼?

這部分才是這篇論文比同類研究值錢的地方——不是實驗室數字,是公司內部真的在跑。

  • 部署超過 10 個月,覆蓋 7,200 台以上公司 MacBook
  • 每天處理 10,000 個以上 agent session
  • 抓到數百組高風險憑證外洩,分屬 26 個類別,這些金鑰已經被傳出公司網路之外
  • 後續補上的事前攔截機制:97.2% 精確率,212 組憑證中正確攔下 206 組,只誤判 6 組
  • 遙測資料保留 13 個月,僅限資安人員依最小權限存取,上線前經法務與隱私團隊審查

「數百組金鑰被 AI 傳出公司網路」這件事,我認為是全篇最該被記住的一句。這不是被駭客攻擊,是員工日常用 AI 工作時順手漏出去的。Uber 有能力發現,是因為他們花十個月建了觀測系統;沒建的公司不是沒發生,是不知道。

他們也誠實寫了兩個運營上的難處:憑證告警量大到人工看不完;以及等偵測跳出來的時候,金鑰通常已經外洩,傷害不可逆。這才促成他們把防線往前移,做成打字時就攔的 hook。

哪些說法目前還沒有證據?

這段是我每篇都會寫的。同一則新聞其他地方會照抄漂亮數字,這裡放站不住腳的部分。

  1. 「開源」目前是預告,不是事實。倉庫裡沒有程式碼,README 寫「即將推出」。授權是 Apache-2.0、3 個 commit、10 顆星(2026-08-06 實查)。現在誰都下載不到、跑不起來。
  2. 數字兩個版本,差 5 倍。Uber 高層在社群平台寫「每天 50,000+ session、數千個端點」,論文寫「10,000+ session、7,200 台主機」。本文一律採論文數字。
  3. 67% 是設計選擇,也是天花板。作者明說在極端不平衡的真實環境下,他們採「精確率優先」,寧可漏也不吵。這代表三分之一的攻擊它看不到,權限濫用那類更是只抓到五分之一。
  4. 測試集不代表真實發生率。作者自己寫明 ADR-Bench「無意反映生產環境中各類事件的真實發生率」。42 比 260 的比例是為了做實驗,不是現實。
  5. 部分測試任務是 AI 生成的。論文說正常任務有一部分是用 GPT-4 依既有任務生成的變體,不是全部來自真實流量。
  6. 生產環境的誤報比跑分難看得多。送人工覆核的告警裡,49% 判定為誤報、17% 是「真的觸發但無惡意」(多半是自家紅隊在演練)。作者解釋那是保守升級不是真誤報,但實際要花的人力就是這麼多。
  7. 自己評自己。論文屬 MLSys 業界議程,系統、測試集、跑分都出自同一個團隊。三個對照組的參數由 Uber 這方設定。這在業界論文很常見,但不等於第三方驗證。
  8. 星數傳言不準。我看到有素材源寫這個倉庫有 1,030 顆星,實查是 10 顆。引用前請自己開一次頁面。

你不是 Uber,這篇對你有什麼用?

老實說,ADR 這套系統你短期內用不到,就算程式碼放出來了也未必裝得動——它預設的場景是幾千台公司電腦、有專職資安團隊做人工覆核。

但那張 17 種手法的表,跟那句「數百組金鑰外洩」,是免費的教訓。你可以現在就做這五件事,全部不用寫程式、不用花錢:

  1. 把金鑰移出 AI 讀得到的範圍。檢查 .env、設定檔、筆記軟體。這一步解掉 Uber 花十個月才發現的那類問題。
  2. 盤點你裝了哪些 MCP server 和外掛,來源不明的先移除。這對應「未查核的 MCP server」和「供應鏈不安全」兩條路。
  3. 把 API token 換成最小權限,能唯讀就別給寫入。對應命中率最低(20%)、也就是最不能指望偵測系統救你的那一類。
  4. 外部來的內容當成不可信。讓 AI 讀網頁、郵件、工單、客戶 PDF 之前,先想一下裡面可不可能藏指令。這是間接提示注入,也是 Agent Flayer 那個真實案例的入口。
  5. 關掉不必要的自動執行。危險動作保留一次人工確認。麻煩,但這是目前最有效的一道。

如果想再往前一步,可以看看 NVIDIA 開源的 SkillSpector,那套是掃你已經裝好的 AI 技能有沒有漏洞,門檻比 ADR 低得多,而且現在就能用。想知道 AI agent 失控起來能做到什麼程度,可以看 AI 為了通過測試自己入侵 Hugging Face 的 17,600 步全記錄——那篇的攻擊路徑,剛好對得上這張表的第 1 類和第 4 類。

有沒有現在就能用的替代方案?

方案現在能用嗎適合誰
Uber ADR❌ 程式碼未釋出有資安團隊的大企業,等釋出
LlamaFirewall(Meta)要現成防護,能接受慢與貴
NVIDIA SkillSpector個人與小團隊,掃已裝的技能漏洞
AgentDojo研究者,做提示注入評測
先把權限收好✅ 零成本所有人,而且該先做這個

最後一列不是湊數。ADR 在權限濫用類別只抓到 20%,反過來說明一件事:這類風險本來就不該靠偵測解決,該靠設定。先把設定做對,比等任何工具都划算。

常見問題

Uber ADR 現在可以下載使用嗎?

不行。截至 2026 年 8 月 6 日,GitHub 倉庫只有 README 和 LICENSE,官方寫明程式碼正在準備釋出。目前能看的只有論文。

ADR 和傳統防毒、EDR 差在哪?

差在看得到的層次。EDR 看到檔案讀寫、程序啟動這類系統動作;ADR 額外抓提示詞、模型推理過程、MCP 工具呼叫的參數與回傳,能把散步驟串成一條因果鏈。攻擊往往藏在鏈裡,單看每一步都正常。

個人使用者需要擔心這 17 種攻擊嗎?

其中五種要。裝了非官方 MCP server、讓 AI 讀得到金鑰、讓 AI 處理外部來的內容、token 開全權限、外掛自動更新——這五個條件個人使用者都很容易滿足,對應間接提示注入、工具權限過大、工具遮蔽、未查核 MCP server、供應鏈不安全。

ADR 的 67% 偵測率算好還是差?

跟對照組比算好,因為它是零誤報下的 67%,F1 比第二名高一倍以上。但絕對值上,三分之一的攻擊漏掉,且權限濫用類只抓到 20%,所以不能當成裝了就安全。

什麼是間接提示注入?

把指令藏在 AI 會讀到的外部內容裡,例如一封郵件、一張工單、一個網頁。使用者沒下這道指令,但 AI 讀進去之後照做了。論文重現的 Agent Flayer 案例就是:惡意郵件自動生成一張 Jira 工單,工單裡藏著指令,開發者的 IDE 透過 MCP 讀取工單後,被誘導去讀本機設定檔並把金鑰傳出去。

結論

Uber ADR 這次真正交出來的不是程式碼,是一份帳本:十個月、7,200 台電腦、每天一萬個 session,換來「數百組金鑰已經流出去了」這個結論,還有一張把 AI agent 攻擊講清楚的分類表。

程式碼什麼時候放出來、放出來之後好不好用,可以之後再看。但那張表你今天就能拿來對照自己的設定,而且對照完會發現,最該補的幾個洞,剛好是這套價值幾千萬的系統最抓不到的那一類。

今天先去看一眼你的 .env 在哪,這件事的投報率比等任何工具都高。

延伸閱讀:Cloudflare 開源 computer:賭 AI agent 九成工作不需要一台完整電腦Desktop Commander:一個 MCP 讓 Claude 直接開你的終端機(含風險)Anthropic 開源 J-lens:看穿 AI 沒說出口的念頭BrowserOS:把 AI agent 留在本機的開源瀏覽器pdf-inspector:54% 的 PDF 根本不用 OCR

資料來源:ADR: An Agentic Detection System for Enterprise Agentic AI Security(arXiv 2605.17380,MLSys 2026 Industry Track)uber/ADR — GitHubMLSys 2026 Poster

本文為技術與資安資訊整理,非資安稽核建議,也不構成任何投資建議。文中數據截至 2026 年 8 月 6 日,引用自公開論文與官方倉庫,實際情況以官方最新公告為準。自測工具為對照論文分類的粗略自評,不能取代專業資安評估。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash