你的 AI 助理現在能讀你的程式碼、開你的終端機、呼叫公司內部工具。有沒有人在旁邊看著它?
一句話結論:Uber ADR 是第一套在真實企業跑了十個月的 AI agent 安全偵測系統,論文公開了 17 種攻擊手法全表與跑分,但 GitHub 上目前只有一份 README,程式碼還沒放出來。
2026 年 8 月,Uber 在 GitHub 開了一個叫 uber/ADR 的倉庫,說明寫著「透過可觀測性、安全基準測試與威脅偵測,保護企業 AI agent。已在 Uber 部署」。技術圈轉了一輪。
我點進去看。三個 commit、一個 LICENSE、一份 README,然後一句話:「程式碼與文件即將推出。」截至 2026 年 8 月 6 日,星數 10。
所以這篇不寫「怎麼安裝」,因為沒東西可以裝。真正有料的是他們那篇論文(arXiv 2605.17380,已被 MLSys 2026 Industry Track 收錄),裡面有一張表,是我今年看過對一般人最有用的 AI 安全資料:17 種針對 AI agent 的攻擊手法完整分類,每一種都對得上已經公開發生過的真實事件。
Uber ADR 是什麼?
ADR 全名 Agentic Detection and Response,直譯就是「代理式偵測與回應」。名字是故意致敬資安圈行之有年的 EDR(端點偵測與回應),而它要解決的問題,正好是 EDR 做不到的那塊。
論文開宗明義點出三個難處,我覺得第一個講得特別準:
現有的 EDR 工具看得到檔案被寫入,卻看不到 agent 的推理過程、提示詞,以及把「意圖」連到「執行」的那條因果鏈。
翻成白話:傳統防毒看到「有個程式寫了一個檔案」,但它不知道這個動作,是因為三步之前有人在一張 Jira 工單裡藏了一句話。單看每一步都正常,合起來才是攻擊。這是 AI agent 時代最麻煩的地方,也是 ADR 整套設計的出發點——資安的最小單位是「整條工作流」,不是「單次工具呼叫」。
另外兩個難處:靜態規則防禦擋不住變形攻擊;每個 session 都丟給大模型判斷,成本會爆掉。
ADR 由哪三個部分組成?
三塊:一個負責看、一個負責判、一個負責先自己打自己。
- ADR Sensor(看):一個裝在電腦上的輕量程式,直接去讀 Cursor、Cline、Claude Code 這類工具本機的 SQLite 資料庫和 JSONL 快取,把散落的紀錄拼回完整 session:提示詞 → 推理 → 工具呼叫 → 結果。每小時跑一次,論文說平均一次 0.182 秒。
- ADR Detector(判):兩層架構。第一層用 GPT-4o 做快速分流,設計原則是寧可錯殺不可放過,有疑慮就往上送;第二層用 Claude Sonnet 4 做深度推理,會去查原始碼、查威脅情報、查公司政策再下判斷。
- ADR Explorer(自己打自己):上線前的紅隊演練模組,三個 agent 分工——一個變異出新攻擊、一個在沙箱裡實測、一個把有價值的發現寫回威脅庫,餵給第二層偵測器。
兩層分流這招是省錢用的。論文的消融實驗說得很清楚:拿掉分流層,偵測率反而從 0.667 升到 0.805,但成本漲 29%、延遲漲 52%,還開始出現誤報。分流層獨力處理掉 40.7% 的任務,每次 0.017 美元、2.3 秒;送到完整推理才要 0.029 美元、29.7 秒。
這是個很誠實的取捨:他們選了「便宜且幾乎不誤報」,代價是放掉一部分攻擊。
17 種 AI agent 攻擊手法,分別是什麼?
這是整篇論文最值得存下來的一張表。5 大類、17 種手法,全部對得上公開發生過的事件(括號內是我補的白話說明)。
| 類別(Tactic) | 手法(Technique) |
|---|---|
| 1. 初始入侵與執行 拿到控制權、跑出第一個惡意動作 | 供應鏈不安全(你裝的套件本身有毒) |
| 間接提示注入(指令藏在網頁、郵件、工單裡) | |
| 控制流劫持(把 agent 的執行順序帶偏) | |
| 程式碼直譯器濫用(借 agent 的執行環境跑東西) | |
| 輸出處理不安全(agent 吐出來的東西被下游直接信任) | |
| 工具抽單(Tool Rug Pull,先給你乾淨版本,之後偷改) | |
| 2. 權限濫用 超出該有的存取範圍 | 工具權限給太大(能讀的遠超該讀的) |
| Agent 身分偽冒 | |
| 3. 繞過安全控制 躲過偵測機制 | 工具遮蔽(Tool Shadowing,放個同名工具把正牌蓋掉) |
| 工具幻覺操縱(誘導 agent 去呼叫不存在的工具) | |
| 惡意 agent 串謀(多個 agent 配合作案) | |
| 4. 推理與資料操縱 汙染資料或帶歪判斷 | 接上未查核的 MCP server |
| 語義資料投毒 | |
| 長期目標劫持(慢慢把 agent 的目標帶走) | |
| 時序資料攻擊 | |
| 5. 營運衝擊 把系統拖垮 | Agent 助長的資源耗盡 |
| 模型層阻斷服務 |
我把加粗的五種挑出來,因為那五種不需要你是 Uber 也會中。只要你裝過來路不明的 MCP server、讓 AI 讀過含金鑰的設定檔、或者讓它連上會收外部訊息的系統(郵件、工單、客服),這五條路就是通的。
你的 AI agent 有多少曝險?(30 秒自測)
照下面勾選,對應到你目前實際打開了哪幾條攻擊路徑。純前端計算,不會送出任何資料。
ADR 到底抓得準不準?
他們自己做了一套測試集 ADR-Bench:302 個任務(42 個惡意、260 個正常)、133 個 MCP server、729 個工具,平均每個任務 28.5 次工具呼叫。17 種攻擊手法全覆蓋——對比同類測試集,AgentDojo 只覆蓋 4 種、MCP-Artifact 和 RAS-Eval 各 3 種。
| 系統 | 精確率 | 召回率 | F1 | 誤報 | 每次成本 | 延遲 |
|---|---|---|---|---|---|---|
| ADR | 1.000 | 0.667 | 0.800 | 0 | $0.024 | 18.5 秒 |
| ALRPHFS | 0.333 | 0.405 | 0.366 | 34 | $0.001 | 9.2 秒 |
| GuardAgent | 0.231 | 0.214 | 0.222 | 30 | $0.012 | 9.4 秒 |
| LlamaFirewall | 0.167 | 0.190 | 0.178 | 40 | $0.459 | 93.8 秒 |
零誤報配 0.800 的 F1,比第二名高一倍以上,這個差距很大。成本比 GuardAgent 貴 2 倍,但比 Meta 的 LlamaFirewall 便宜 19 倍、快 5 倍。
不過召回率 0.667 的意思是:42 個攻擊裡,它漏掉 14 個。拆到各類別看,落差更明顯——繞過安全控制 100%(5/5)、營運衝擊 100%(4/4)、初始入侵 68%(13/19)、推理與資料操縱 56%(5/9),而權限濫用只有 20%(1/5)。
權限濫用剛好是最多人會中、也最好防的一類。工具權限給太大這種事,靠改設定就能解決,不需要等任何偵測系統。
在 Uber 真實跑了十個月,發生了什麼?
這部分才是這篇論文比同類研究值錢的地方——不是實驗室數字,是公司內部真的在跑。
- 部署超過 10 個月,覆蓋 7,200 台以上公司 MacBook
- 每天處理 10,000 個以上 agent session
- 抓到數百組高風險憑證外洩,分屬 26 個類別,這些金鑰已經被傳出公司網路之外
- 後續補上的事前攔截機制:97.2% 精確率,212 組憑證中正確攔下 206 組,只誤判 6 組
- 遙測資料保留 13 個月,僅限資安人員依最小權限存取,上線前經法務與隱私團隊審查
「數百組金鑰被 AI 傳出公司網路」這件事,我認為是全篇最該被記住的一句。這不是被駭客攻擊,是員工日常用 AI 工作時順手漏出去的。Uber 有能力發現,是因為他們花十個月建了觀測系統;沒建的公司不是沒發生,是不知道。
他們也誠實寫了兩個運營上的難處:憑證告警量大到人工看不完;以及等偵測跳出來的時候,金鑰通常已經外洩,傷害不可逆。這才促成他們把防線往前移,做成打字時就攔的 hook。
哪些說法目前還沒有證據?
這段是我每篇都會寫的。同一則新聞其他地方會照抄漂亮數字,這裡放站不住腳的部分。
- 「開源」目前是預告,不是事實。倉庫裡沒有程式碼,README 寫「即將推出」。授權是 Apache-2.0、3 個 commit、10 顆星(2026-08-06 實查)。現在誰都下載不到、跑不起來。
- 數字兩個版本,差 5 倍。Uber 高層在社群平台寫「每天 50,000+ session、數千個端點」,論文寫「10,000+ session、7,200 台主機」。本文一律採論文數字。
- 67% 是設計選擇,也是天花板。作者明說在極端不平衡的真實環境下,他們採「精確率優先」,寧可漏也不吵。這代表三分之一的攻擊它看不到,權限濫用那類更是只抓到五分之一。
- 測試集不代表真實發生率。作者自己寫明 ADR-Bench「無意反映生產環境中各類事件的真實發生率」。42 比 260 的比例是為了做實驗,不是現實。
- 部分測試任務是 AI 生成的。論文說正常任務有一部分是用 GPT-4 依既有任務生成的變體,不是全部來自真實流量。
- 生產環境的誤報比跑分難看得多。送人工覆核的告警裡,49% 判定為誤報、17% 是「真的觸發但無惡意」(多半是自家紅隊在演練)。作者解釋那是保守升級不是真誤報,但實際要花的人力就是這麼多。
- 自己評自己。論文屬 MLSys 業界議程,系統、測試集、跑分都出自同一個團隊。三個對照組的參數由 Uber 這方設定。這在業界論文很常見,但不等於第三方驗證。
- 星數傳言不準。我看到有素材源寫這個倉庫有 1,030 顆星,實查是 10 顆。引用前請自己開一次頁面。
你不是 Uber,這篇對你有什麼用?
老實說,ADR 這套系統你短期內用不到,就算程式碼放出來了也未必裝得動——它預設的場景是幾千台公司電腦、有專職資安團隊做人工覆核。
但那張 17 種手法的表,跟那句「數百組金鑰外洩」,是免費的教訓。你可以現在就做這五件事,全部不用寫程式、不用花錢:
- 把金鑰移出 AI 讀得到的範圍。檢查 .env、設定檔、筆記軟體。這一步解掉 Uber 花十個月才發現的那類問題。
- 盤點你裝了哪些 MCP server 和外掛,來源不明的先移除。這對應「未查核的 MCP server」和「供應鏈不安全」兩條路。
- 把 API token 換成最小權限,能唯讀就別給寫入。對應命中率最低(20%)、也就是最不能指望偵測系統救你的那一類。
- 外部來的內容當成不可信。讓 AI 讀網頁、郵件、工單、客戶 PDF 之前,先想一下裡面可不可能藏指令。這是間接提示注入,也是 Agent Flayer 那個真實案例的入口。
- 關掉不必要的自動執行。危險動作保留一次人工確認。麻煩,但這是目前最有效的一道。
如果想再往前一步,可以看看 NVIDIA 開源的 SkillSpector,那套是掃你已經裝好的 AI 技能有沒有漏洞,門檻比 ADR 低得多,而且現在就能用。想知道 AI agent 失控起來能做到什麼程度,可以看 AI 為了通過測試自己入侵 Hugging Face 的 17,600 步全記錄——那篇的攻擊路徑,剛好對得上這張表的第 1 類和第 4 類。
有沒有現在就能用的替代方案?
| 方案 | 現在能用嗎 | 適合誰 |
|---|---|---|
| Uber ADR | ❌ 程式碼未釋出 | 有資安團隊的大企業,等釋出 |
| LlamaFirewall(Meta) | ✅ | 要現成防護,能接受慢與貴 |
| NVIDIA SkillSpector | ✅ | 個人與小團隊,掃已裝的技能漏洞 |
| AgentDojo | ✅ | 研究者,做提示注入評測 |
| 先把權限收好 | ✅ 零成本 | 所有人,而且該先做這個 |
最後一列不是湊數。ADR 在權限濫用類別只抓到 20%,反過來說明一件事:這類風險本來就不該靠偵測解決,該靠設定。先把設定做對,比等任何工具都划算。
常見問題
Uber ADR 現在可以下載使用嗎?
不行。截至 2026 年 8 月 6 日,GitHub 倉庫只有 README 和 LICENSE,官方寫明程式碼正在準備釋出。目前能看的只有論文。
ADR 和傳統防毒、EDR 差在哪?
差在看得到的層次。EDR 看到檔案讀寫、程序啟動這類系統動作;ADR 額外抓提示詞、模型推理過程、MCP 工具呼叫的參數與回傳,能把散步驟串成一條因果鏈。攻擊往往藏在鏈裡,單看每一步都正常。
個人使用者需要擔心這 17 種攻擊嗎?
其中五種要。裝了非官方 MCP server、讓 AI 讀得到金鑰、讓 AI 處理外部來的內容、token 開全權限、外掛自動更新——這五個條件個人使用者都很容易滿足,對應間接提示注入、工具權限過大、工具遮蔽、未查核 MCP server、供應鏈不安全。
ADR 的 67% 偵測率算好還是差?
跟對照組比算好,因為它是零誤報下的 67%,F1 比第二名高一倍以上。但絕對值上,三分之一的攻擊漏掉,且權限濫用類只抓到 20%,所以不能當成裝了就安全。
什麼是間接提示注入?
把指令藏在 AI 會讀到的外部內容裡,例如一封郵件、一張工單、一個網頁。使用者沒下這道指令,但 AI 讀進去之後照做了。論文重現的 Agent Flayer 案例就是:惡意郵件自動生成一張 Jira 工單,工單裡藏著指令,開發者的 IDE 透過 MCP 讀取工單後,被誘導去讀本機設定檔並把金鑰傳出去。
結論
Uber ADR 這次真正交出來的不是程式碼,是一份帳本:十個月、7,200 台電腦、每天一萬個 session,換來「數百組金鑰已經流出去了」這個結論,還有一張把 AI agent 攻擊講清楚的分類表。
程式碼什麼時候放出來、放出來之後好不好用,可以之後再看。但那張表你今天就能拿來對照自己的設定,而且對照完會發現,最該補的幾個洞,剛好是這套價值幾千萬的系統最抓不到的那一類。
今天先去看一眼你的 .env 在哪,這件事的投報率比等任何工具都高。
延伸閱讀:Cloudflare 開源 computer:賭 AI agent 九成工作不需要一台完整電腦|Desktop Commander:一個 MCP 讓 Claude 直接開你的終端機(含風險)|Anthropic 開源 J-lens:看穿 AI 沒說出口的念頭|BrowserOS:把 AI agent 留在本機的開源瀏覽器|pdf-inspector:54% 的 PDF 根本不用 OCR
資料來源:ADR: An Agentic Detection System for Enterprise Agentic AI Security(arXiv 2605.17380,MLSys 2026 Industry Track)|uber/ADR — GitHub|MLSys 2026 Poster
本文為技術與資安資訊整理,非資安稽核建議,也不構成任何投資建議。文中數據截至 2026 年 8 月 6 日,引用自公開論文與官方倉庫,實際情況以官方最新公告為準。自測工具為對照論文分類的粗略自評,不能取代專業資安評估。





發表迴響