你裝的那個 AI Skill,有沒有人掃過?這問題現在有工具答了。但真正麻煩的是下一個問題:掃描器自己,可信嗎?
一句話結論:AI-Infra-Guard 是騰訊朱雀實驗室開源的 AI 紅隊平台,一套掃完 Agent、Skills、MCP Server 與 AI 基礎設施。但它的技術報告揭露一件更值得注意的事:同一個掃描器換不同基座模型,誤報率從 1.20% 到 18.67%,相差 15.6 倍。
本文資料截至 2026 年 8 月 22 日,數據以 GitHub 官方倉庫與 arXiv 技術報告為準。
AI-Infra-Guard 是什麼?
它是一個「全棧 AI 紅隊平台」,由騰訊安全平台部旗下的朱雀實驗室主導開發。紅隊的意思是主動攻擊自己人,找出漏洞再補,而不是被動等著防。
倉庫掛在 GitHub 的 Tencent 官方組織底下,不是同名的社群項目。這一點值得先講清楚,因為 GitHub 上不少倉庫名字帶大廠名稱、實際是個人帳號的作品。這個是真的官方出品,技術報告的通訊信箱是 zhuque@tencent.com,第一作者楊勇是騰訊安全平台部負責人。
授權是 Apache 2.0(2026 年 3 月從 MIT 遷移過來),目前約 5,300 顆星、510 個 fork。
為什麼一個 19 個月的老項目,這幾天才衝上榜?
因為它不是新項目,只是剛好在紅。
第一個版本 v0.0.1 發在 2025 年 1 月 2 日,到現在約 19.6 個月,累積 54 個 release、1,809 次提交。它在 8 月 20 日衝上 GitHub Trending 的 Python 榜第 4 名(全語言榜是第 16 名),最近四天漲了約 700 顆星。它更早在 2025 年 4 月就上過 Go 榜,所以這也不是它第一次上榜。
這個區別很重要。看到 GitHub 榜就寫「某某今天開源了」是最常見的錯誤,榜單反映的是當下的關注度,不是發布日期(對照一下真正當天釋出的開源專案長什麼樣,差別很明顯)。這個項目已經迭代到 v4.5.2(2026 年 8 月 17 日發布),跟「剛出爐」差了一年半。
順帶一提,官方自己也把 v4.5.0 的日期寫錯過。7 月 30 日有一筆提交紀錄寫著:把 v4.5.0 的發布日期從 2026-07-24 更正為 2026-07-27,橫跨 9 個語言版本的 README。所以你現在在網路上搜到的 7 月 24 日,是更正前的舊資料。
它到底掃什麼?
五個模組,覆蓋從基礎設施到模型的四層攻擊面:
| 模組 | 掃什麼 | 你要餵它什麼 |
|---|---|---|
| AI 基礎設施掃描 | Ollama、ComfyUI、vLLM、n8n、Triton 等框架的已知漏洞 | 執行中服務的網路位址(非 GitHub 連結) |
| MCP Server 與 Skills 掃描 | 供應鏈投毒、隱藏提示詞注入、遠端載荷執行、憑證竊取 | 遠端網址或本地原始碼壓縮檔,不需要跑起來 |
| Agent 掃描 | Agent 工作流程的安全性,支援 Dify、Coze 等平台 | Agent 端點 |
| ClawScan | OpenClaw 的不安全設定、Skill 風險、CVE、隱私外洩 | 一鍵評估 |
| 越獄評測 | 16 個紅隊資料集、7,248 條有害提示詞,跨模型比較穩健度 | 模型 base URL 與 API key |
MCP 那一格是重點。技術報告寫明靜態審計器內建十種檢測模式,其中工具投毒、工具遮蔽、抽地毯(rug pull)、工具名混淆這四種,在傳統程式碼審查裡根本沒有對應概念,是 MCP 生態獨有的攻擊面。如果你有在接 MCP server 到本機終端機,這幾種風險值得知道長什麼樣。
換個基座模型,掃描結果差多少?
差很多。這是整份技術報告裡唯一一張量化成績表,也是最值得看的一張。
團隊做了一件事:審計規格完全不動,只換底下的大模型,看同一個 Skill 掃描器表現差多少。結果如下(依論文的 loose F1 排序):
| 排名 | 基座模型 | Loose F1 | 精確率 | 召回率 | 誤報率 FPR |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | 0.9848 | 0.9725 | 0.9974 | 0.0663 |
| 2 | GLM 5.1 | 0.9836 | 0.9701 | 0.9974 | 0.0723 |
| 3 | Gemini 3.5 Flash | 0.9792 | 0.9947 | 0.9641 | 0.0120 |
| 4 | Kimi 2.6 | 0.9780 | 0.9895 | 0.9667 | 0.0241 |
| 5 | DeepSeek v4 Flash | 0.9740 | 0.9868 | 0.9615 | 0.0301 |
| 6 | Hy3 Preview | 0.9714 | 0.9868 | 0.9564 | 0.0301 |
| 7 | MiniMax M2.7 | 0.9623 | 0.9763 | 0.9487 | 0.0542 |
| 8 | Mimo v2.5 | 0.9598 | 0.9711 | 0.9487 | 0.0663 |
| 9 | GPT 5.5 | 0.9566 | 0.9257 | 0.9897 | 0.1867 |
九個模型的 F1 從 0.9566 到 0.9848,看起來全部都很好,差距不到 3 個百分點。
但看最後一欄。誤報率從 1.20% 到 18.67%。
為什麼排第一的不一定是你要的?
因為排序用的 F1,把你在實務上最在意的東西藏起來了。
排名第一的 Claude Opus 4.6,誤報率 6.63%。排名第三的 Gemini 3.5 Flash,誤報率 1.20%。第一名的誤報率,是第三名的 5.5 倍。而兩者的 F1 只差 0.0056。
換成日常語言:假設你要掃 1,000 個沒問題的 Skill,用 Opus 4.6 會有大約 66 個被誤標成有風險,用 Gemini 3.5 Flash 只有 12 個。用 GPT 5.5 的話,187 個。
187 個假警報是什麼概念?是沒有人會再看警報。安全工具死掉的方式從來不是漏報,是叫太多次狼來了,然後所有人開始無視它。
反過來說,Opus 4.6 的召回率 0.9974,代表 100 個真風險它只漏 0.3 個;Gemini 3.5 Flash 漏 3.6 個。所以這不是「Gemini 比較好」,而是兩種完全不同的取捨:一個寧可錯殺,一個寧可放過。
你要哪一種,取決於你掃幾個、誰看報告、看不完會怎樣。下面這個工具幫你算。
掃描器基座模型選擇器
用技術報告 Table 3 的真實數據換算。拉動滑桿看不同模型會產生多少假警報、漏掉多少真風險。
假警報 = 乾淨樣本數 × FPR;漏掉真風險 = 風險樣本數 × (1 − 召回率)。此處假設你掃的樣本中約 10% 真的有風險(實務常見比例),與論文測試集的組成不同,僅作情境換算。
這張成績表有哪些地方要留意?
四個,按重要性排。
一、評測基準是自己出的。SkillTrustBench 由朱雀實驗室與香港中文大學(深圳)聯合發布,託管在自家的 HuggingFace 空間,排行榜也是自己維護。這不代表數據造假,開源專案自建基準很常見,有學術單位共同掛名也比純自建好一些,但你看成績時要記得出題的和考試的高度重疊。外部背書方面,OpenClaw 生態的 ClawScan 把它列為推薦評測基準之一。
二、上面那張表不是跟其他工具比。很多轉述會寫成「AI-Infra-Guard 在 SkillTrustBench 拿下最高分」,這是誤讀。表格標題寫得很清楚,比的是同一個掃描器在不同基座模型下的表現。第一名是 Claude Opus 4.6,那是一個模型名稱,不是競爭產品。
不過講句公道話:SkillTrustBench 官網另外還有一張外部掃描器排行榜,那張才是真的跟同業比。目前的數字是這樣:
| 外部掃描器 | F1 | 誤報率 FPR |
|---|---|---|
| Skill Vetter(OpenClaw) | 0.9659 | 0.1145 |
| Skill Vetter(Hermes) | 0.9592 | 0.1084 |
| Cisco Skill Scanner | 0.9265 | 0.2470 |
| NVIDIA SkillSpector | 0.9040 | 0.1265 |
AI-Infra-Guard 的 0.9848 確實高過這幾個。但請記得這是在它自己出的考卷上比的,而且外部工具是由出題方代跑的,不是各家自己調校過來應試。這種比較看看就好。真正值得帶走的是右邊那欄:連同業最好的 Skill Vetter,誤報率也有 11%,Cisco 更接近 25%。整個品類目前都還在為誤報付代價,這才是重點。
至於論文正文那張跟 Nuclei、Semgrep、garak、PyRIT、promptfoo 的比較,就真的只有打勾,沒有任何數字,而且作者自己那一列九個欄位全部打勾。
三、「Loose F1」沒有定義。論文全文出現四次這個詞,全部是拿來用,沒有一處說明「loose」寬鬆在哪裡、跟嚴格版差在哪。一個評測基準的招牌指標帶著未定義的修飾詞,是個實在的弱點。
四、測試規模可能比你以為的小。論文說基準「從 62,652 個 Skill 蒸餾出 5,520 個評測案例」,緊接著就是這張成績表,很容易讓人以為表格是在 5,520 個案例上跑出來的。
本站自行核算過:表格裡 9 個模型 × 4 個指標共 36 個數值,全部可以用390 個風險樣本 + 166 個乾淨樣本=556 個案例的整數混淆矩陣完美還原,小數點後四位誤差為零。把官網外部掃描器榜那 4 列一起算進去,13 列共 52 個公開數值,全部落在同一個 390/166 的切分上。
反過來測:所有加起來等於 5,520 的整數組合共 5,519 種,沒有任何一種能同時對上這九列。
換句話說,排行榜跑的是一個約 556 個案例的子集,論文沒有說明是哪一個。這是本站的推算,不是論文陳述,方法已寫在上面,你可以自己驗。
順帶一提,390 比 166 意味著測試集約七成是有風險的樣本。這一點跟完整基準的組成對得上(官方資料卡顯示 5,520 個案例裡有 2,863 個惡意、1,014 個可疑,非正常樣本佔 70.24%,而 390÷556=70.14%),所以它看起來是個分層抽樣的子集,不是隨手挑的。但七成陽性這個比例本身就會讓 F1 看起來比實際部署情況漂亮——真實世界裡你掃的 Skill 絕大多數是乾淨的,那正是誤報率會咬人的場景。
怎麼安裝?
需求:Docker 20.10 以上、4GB 記憶體、10GB 硬碟。三種方式選一種。
方式一:一鍵腳本(最快)
curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash
會自動裝好 Docker 並啟動服務。跑完開 http://localhost:8088。
方式二:Docker Compose(拉預建映像檔)
git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
docker-compose -f docker-compose.images.yml up -d
方式三:只要 Skill 掃描(不用裝整套)
v4.5.0 起三個掃描器都拆成獨立 CLI,Skill 掃描器上了 PyPI:
pip install aig-skill-scan
這對多數人是最實際的。你未必需要一整套紅隊平台,可能只是想在裝一個 Skill 前掃一下。如果你已經在用 OpenClaw,也可以直接 clawhub install aig-scanner 從對話裡呼叫。
有什麼是它做不到的?
先講最要緊的一條,官方自己寫在 README 裡:
本專案定位為企業或個人內部使用的 AI 紅隊平台,目前缺乏身份驗證機制,不應部署在公開網路上。
一個掃漏洞的工具,自己沒有登入機制。這不是隱藏缺陷,是官方明講的使用邊界,但很容易被忽略。內網跑可以,別開到公網。
其他幾點:
- 只有一個模組有量化評測。整份技術報告只有前面那張表。基礎設施掃描、MCP 審計、Agent 紅隊這三個模組,沒有任何檢出率或準確率數據。這是技術報告,不是經過評測的系統論文。
- LLM 審計器的主要失效模式是過度回報。這是論文自己的話:「規則必須如此費力地說明不要回報什麼,本身就是一個徵兆。」他們花大量篇幅寫排除條件,就是在對抗模型的過度熱心。
- 官方數字自己打架。元件覆蓋數在不同地方分別寫成 64、75、100+、130;漏洞規則數寫成 1,443、1,700+、1,888、1,900+、2,000+,另外
CLAUDE.md裡還留著「589+ CVE 規則」。風險分類數也是,README 一處寫 Skill 掃描覆蓋 9 類,另一處寫 MCP 與 Skills 掃描覆蓋 14 類,而官方 MCP 掃描文件自己列出來的是 9 項,論文 Table 10 寫 10 種。四個數字互不相符。要引用的話建議標明版本與出處,別當成現行數字。 - 越獄評測只描述儀器,沒有讀數。16 個資料集、7,248 條提示詞都列得很清楚,但論文沒有給出任何一個模型的實際攻擊成功率。想知道各家模型的安全防護實際做到什麼程度,這份報告幫不到你。
跟 SkillSpector、Uber ADR 差在哪?
差在覆蓋範圍與角色。這三個常被放在一起講,其實解決不同的問題。
| 工具 | 定位 | 覆蓋 | 適合 |
|---|---|---|---|
| AI-Infra-Guard | 全棧紅隊平台 | 基礎設施+MCP+Skills+Agent+模型 | 要一套掃完全部的團隊 |
| NVIDIA SkillSpector | Skill 專用掃描器 | 只掃 Agent Skills | 只在意裝進來的 Skill 乾不乾淨 |
| Uber ADR | 執行期防禦系統 | Agent 執行中的攻擊攔截 | Agent 已上線、要即時擋 |
最大的分別是掃描時機。SkillSpector 與 AI-Infra-Guard 都是事前靜態審查,看程式碼有沒有問題;Uber ADR 是事中攔截,Agent 已經在跑了才動手。前兩者防的是你裝錯東西,後者防的是裝對了但被騙。
另外值得對照的是 Skill 的品質問題——安全和好不好用是兩回事。一個 Skill 可以完全沒有惡意程式碼,但寫得爛到讓你的 Agent 變笨。這兩種掃描解決的不是同一件事。
誰該裝?誰不用裝?
該裝:你的團隊在生產環境跑 Agent 平台,或者自架了 Ollama、vLLM、ComfyUI 這類服務。基礎設施掃描那一格對你最有價值,那是 CVE 比對,不靠模型判斷,最不容易出錯。
裝輕量版就好:你只是個人用戶,偶爾從市集裝 Skill。pip install aig-skill-scan 就夠,不用整套 Docker。
不用裝:你只用官方 App 聊天,不裝第三方 Skill、不接 MCP、不自架模型服務。這套工具的所有攻擊面你都沒有。
最後一句實話:這篇文章裡最有用的東西,可能不是這個工具本身,而是那張成績表透露的原則。任何用大模型當判斷核心的工具,你都該問一句它底下跑的是哪個模型——同樣的程式碼、同樣的規則,換個大腦,誤報率差 15.6 倍。這個問題適用的範圍,遠不只安全掃描器。
常見問題
AI-Infra-Guard 是免費的嗎?
是,Apache 2.0 授權完全免費。另有需要邀請碼的 Pro 版,優先給有提交 issue、PR 或參與社群的貢獻者。要注意授權條款要求保留 NOTICE 檔並標明來源,禁止改包成自有產品而不揭露出處。
它需要 API key 嗎?
看你用哪個模組。基礎設施掃描是規則比對,不需要模型。MCP 與 Skills 掃描、Agent 掃描、越獄評測都靠大模型判斷,要在設定裡填 base URL 與 API key。掃描費用等於模型的 token 費用,掃越多花越多。
掃出來的結果可以直接相信嗎?
不建議直接相信,尤其是靠模型判斷的那幾個模組。論文自己說 LLM 審計器的主要失效模式是過度回報,實測誤報率視基座模型從 1.2% 到 18.67% 不等。把它當成篩選器,把可疑的挑出來給人看,而不是當成最終判決。
SkillTrustBench 的 0.9848 是打敗了其他掃描工具嗎?
那張 0.9848 的表不是。它是 AI-Infra-Guard 自己的 Skill 掃描器在換用不同基座模型時的排行榜,第一名 Claude Opus 4.6 是模型名稱,不是競爭產品。不過 SkillTrustBench 官網另有一張外部掃描器榜(Skill Vetter 0.9659、Cisco Skill Scanner 0.9265、NVIDIA SkillSpector 0.9040),在那張榜上 AI-Infra-Guard 的分數確實較高——但那是它自己出的考卷,外部工具也是由出題方代跑,參考價值有限。
可以架在公司對外的伺服器上讓大家用嗎?
不可以。官方 README 明確寫著目前缺乏身份驗證機制,不應部署在公開網路上。內網或本機使用是它預期的場景。
資料來源
- Tencent/AI-Infra-Guard GitHub 倉庫(星數、版本、功能表、安裝指令、部署警告,2026-08-22 查核)
- arXiv:2606.31227v1《Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming》(2026-06-30 提交,Table 3 成績表、十種 MCP 檢測模式、越獄資料集)
- SkillTrustBench 資料集(標籤分佈:2,863 惡意 / 1,014 可疑 / 共 5,520 案例)
- SkillTrustBench 官方排行榜(外部掃描器榜數據,2026-08-22 查核)
- GitHub API
/repos/Tencent/AI-Infra-Guard(星數 5,345、fork 511、54 個 release、1,809 次提交,2026-08-22 查核)
本文引用之數據皆註明版本與查核日期。文中「約 556 個評測案例」為本站依表格數值反推之推算,並非論文陳述,推算方法已於文中說明。
免責聲明:本文為技術工具介紹與公開資料整理,不構成任何投資建議或安全保證。開源軟體之使用風險由使用者自行承擔,安裝前請自行評估。AI 工具版本更新極快,文中數據截至 2026 年 8 月 22 日,實際功能與數值請以官方倉庫為準。





發表迴響