你裝的那個 AI Skill,有沒有人掃過?這問題現在有工具答了。但真正麻煩的是下一個問題:掃描器自己,可信嗎?

一句話結論:AI-Infra-Guard 是騰訊朱雀實驗室開源的 AI 紅隊平台,一套掃完 Agent、Skills、MCP Server 與 AI 基礎設施。但它的技術報告揭露一件更值得注意的事:同一個掃描器換不同基座模型,誤報率從 1.20% 到 18.67%,相差 15.6 倍。

本文資料截至 2026 年 8 月 22 日,數據以 GitHub 官方倉庫與 arXiv 技術報告為準。

AI-Infra-Guard 是什麼?

它是一個「全棧 AI 紅隊平台」,由騰訊安全平台部旗下的朱雀實驗室主導開發。紅隊的意思是主動攻擊自己人,找出漏洞再補,而不是被動等著防。

倉庫掛在 GitHub 的 Tencent 官方組織底下,不是同名的社群項目。這一點值得先講清楚,因為 GitHub 上不少倉庫名字帶大廠名稱、實際是個人帳號的作品。這個是真的官方出品,技術報告的通訊信箱是 zhuque@tencent.com,第一作者楊勇是騰訊安全平台部負責人。

授權是 Apache 2.0(2026 年 3 月從 MIT 遷移過來),目前約 5,300 顆星、510 個 fork。

為什麼一個 19 個月的老項目,這幾天才衝上榜?

因為它不是新項目,只是剛好在紅。

第一個版本 v0.0.1 發在 2025 年 1 月 2 日,到現在約 19.6 個月,累積 54 個 release、1,809 次提交。它在 8 月 20 日衝上 GitHub Trending 的 Python 榜第 4 名(全語言榜是第 16 名),最近四天漲了約 700 顆星。它更早在 2025 年 4 月就上過 Go 榜,所以這也不是它第一次上榜。

這個區別很重要。看到 GitHub 榜就寫「某某今天開源了」是最常見的錯誤,榜單反映的是當下的關注度,不是發布日期(對照一下真正當天釋出的開源專案長什麼樣,差別很明顯)。這個項目已經迭代到 v4.5.2(2026 年 8 月 17 日發布),跟「剛出爐」差了一年半。

順帶一提,官方自己也把 v4.5.0 的日期寫錯過。7 月 30 日有一筆提交紀錄寫著:把 v4.5.0 的發布日期從 2026-07-24 更正為 2026-07-27,橫跨 9 個語言版本的 README。所以你現在在網路上搜到的 7 月 24 日,是更正前的舊資料。

它到底掃什麼?

五個模組,覆蓋從基礎設施到模型的四層攻擊面:

模組掃什麼你要餵它什麼
AI 基礎設施掃描Ollama、ComfyUI、vLLM、n8n、Triton 等框架的已知漏洞執行中服務的網路位址(非 GitHub 連結)
MCP Server 與 Skills 掃描供應鏈投毒、隱藏提示詞注入、遠端載荷執行、憑證竊取遠端網址或本地原始碼壓縮檔,不需要跑起來
Agent 掃描Agent 工作流程的安全性,支援 Dify、Coze 等平台Agent 端點
ClawScanOpenClaw 的不安全設定、Skill 風險、CVE、隱私外洩一鍵評估
越獄評測16 個紅隊資料集、7,248 條有害提示詞,跨模型比較穩健度模型 base URL 與 API key

MCP 那一格是重點。技術報告寫明靜態審計器內建十種檢測模式,其中工具投毒、工具遮蔽、抽地毯(rug pull)、工具名混淆這四種,在傳統程式碼審查裡根本沒有對應概念,是 MCP 生態獨有的攻擊面。如果你有在接 MCP server 到本機終端機,這幾種風險值得知道長什麼樣。

換個基座模型,掃描結果差多少?

差很多。這是整份技術報告裡唯一一張量化成績表,也是最值得看的一張。

團隊做了一件事:審計規格完全不動,只換底下的大模型,看同一個 Skill 掃描器表現差多少。結果如下(依論文的 loose F1 排序):

排名基座模型Loose F1精確率召回率誤報率 FPR
1Claude Opus 4.60.98480.97250.99740.0663
2GLM 5.10.98360.97010.99740.0723
3Gemini 3.5 Flash0.97920.99470.96410.0120
4Kimi 2.60.97800.98950.96670.0241
5DeepSeek v4 Flash0.97400.98680.96150.0301
6Hy3 Preview0.97140.98680.95640.0301
7MiniMax M2.70.96230.97630.94870.0542
8Mimo v2.50.95980.97110.94870.0663
9GPT 5.50.95660.92570.98970.1867

九個模型的 F1 從 0.9566 到 0.9848,看起來全部都很好,差距不到 3 個百分點。

但看最後一欄。誤報率從 1.20% 到 18.67%

為什麼排第一的不一定是你要的?

因為排序用的 F1,把你在實務上最在意的東西藏起來了。

排名第一的 Claude Opus 4.6,誤報率 6.63%。排名第三的 Gemini 3.5 Flash,誤報率 1.20%。第一名的誤報率,是第三名的 5.5 倍。而兩者的 F1 只差 0.0056。

換成日常語言:假設你要掃 1,000 個沒問題的 Skill,用 Opus 4.6 會有大約 66 個被誤標成有風險,用 Gemini 3.5 Flash 只有 12 個。用 GPT 5.5 的話,187 個。

187 個假警報是什麼概念?是沒有人會再看警報。安全工具死掉的方式從來不是漏報,是叫太多次狼來了,然後所有人開始無視它。

反過來說,Opus 4.6 的召回率 0.9974,代表 100 個真風險它只漏 0.3 個;Gemini 3.5 Flash 漏 3.6 個。所以這不是「Gemini 比較好」,而是兩種完全不同的取捨:一個寧可錯殺,一個寧可放過。

你要哪一種,取決於你掃幾個、誰看報告、看不完會怎樣。下面這個工具幫你算。

掃描器基座模型選擇器

用技術報告 Table 3 的真實數據換算。拉動滑桿看不同模型會產生多少假警報、漏掉多少真風險。

模型 假警報 漏掉真風險

假警報 = 乾淨樣本數 × FPR;漏掉真風險 = 風險樣本數 × (1 − 召回率)。此處假設你掃的樣本中約 10% 真的有風險(實務常見比例),與論文測試集的組成不同,僅作情境換算。

這張成績表有哪些地方要留意?

四個,按重要性排。

一、評測基準是自己出的。SkillTrustBench 由朱雀實驗室與香港中文大學(深圳)聯合發布,託管在自家的 HuggingFace 空間,排行榜也是自己維護。這不代表數據造假,開源專案自建基準很常見,有學術單位共同掛名也比純自建好一些,但你看成績時要記得出題的和考試的高度重疊。外部背書方面,OpenClaw 生態的 ClawScan 把它列為推薦評測基準之一。

二、上面那張表不是跟其他工具比。很多轉述會寫成「AI-Infra-Guard 在 SkillTrustBench 拿下最高分」,這是誤讀。表格標題寫得很清楚,比的是同一個掃描器在不同基座模型下的表現。第一名是 Claude Opus 4.6,那是一個模型名稱,不是競爭產品。

不過講句公道話:SkillTrustBench 官網另外還有一張外部掃描器排行榜,那張才是真的跟同業比。目前的數字是這樣:

外部掃描器F1誤報率 FPR
Skill Vetter(OpenClaw)0.96590.1145
Skill Vetter(Hermes)0.95920.1084
Cisco Skill Scanner0.92650.2470
NVIDIA SkillSpector0.90400.1265

AI-Infra-Guard 的 0.9848 確實高過這幾個。但請記得這是在它自己出的考卷上比的,而且外部工具是由出題方代跑的,不是各家自己調校過來應試。這種比較看看就好。真正值得帶走的是右邊那欄:連同業最好的 Skill Vetter,誤報率也有 11%,Cisco 更接近 25%。整個品類目前都還在為誤報付代價,這才是重點。

至於論文正文那張跟 Nuclei、Semgrep、garak、PyRIT、promptfoo 的比較,就真的只有打勾,沒有任何數字,而且作者自己那一列九個欄位全部打勾。

三、「Loose F1」沒有定義。論文全文出現四次這個詞,全部是拿來用,沒有一處說明「loose」寬鬆在哪裡、跟嚴格版差在哪。一個評測基準的招牌指標帶著未定義的修飾詞,是個實在的弱點。

四、測試規模可能比你以為的小。論文說基準「從 62,652 個 Skill 蒸餾出 5,520 個評測案例」,緊接著就是這張成績表,很容易讓人以為表格是在 5,520 個案例上跑出來的。

本站自行核算過:表格裡 9 個模型 × 4 個指標共 36 個數值,全部可以用390 個風險樣本 + 166 個乾淨樣本=556 個案例的整數混淆矩陣完美還原,小數點後四位誤差為零。把官網外部掃描器榜那 4 列一起算進去,13 列共 52 個公開數值,全部落在同一個 390/166 的切分上。

反過來測:所有加起來等於 5,520 的整數組合共 5,519 種,沒有任何一種能同時對上這九列

換句話說,排行榜跑的是一個約 556 個案例的子集,論文沒有說明是哪一個。這是本站的推算,不是論文陳述,方法已寫在上面,你可以自己驗。

順帶一提,390 比 166 意味著測試集約七成是有風險的樣本。這一點跟完整基準的組成對得上(官方資料卡顯示 5,520 個案例裡有 2,863 個惡意、1,014 個可疑,非正常樣本佔 70.24%,而 390÷556=70.14%),所以它看起來是個分層抽樣的子集,不是隨手挑的。但七成陽性這個比例本身就會讓 F1 看起來比實際部署情況漂亮——真實世界裡你掃的 Skill 絕大多數是乾淨的,那正是誤報率會咬人的場景。

怎麼安裝?

需求:Docker 20.10 以上、4GB 記憶體、10GB 硬碟。三種方式選一種。

方式一:一鍵腳本(最快)

curl https://raw.githubusercontent.com/Tencent/AI-Infra-Guard/refs/heads/main/docker.sh | bash

會自動裝好 Docker 並啟動服務。跑完開 http://localhost:8088

方式二:Docker Compose(拉預建映像檔)

git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
docker-compose -f docker-compose.images.yml up -d

方式三:只要 Skill 掃描(不用裝整套)

v4.5.0 起三個掃描器都拆成獨立 CLI,Skill 掃描器上了 PyPI:

pip install aig-skill-scan

這對多數人是最實際的。你未必需要一整套紅隊平台,可能只是想在裝一個 Skill 前掃一下。如果你已經在用 OpenClaw,也可以直接 clawhub install aig-scanner 從對話裡呼叫。

有什麼是它做不到的?

先講最要緊的一條,官方自己寫在 README 裡:

本專案定位為企業或個人內部使用的 AI 紅隊平台,目前缺乏身份驗證機制,不應部署在公開網路上。

一個掃漏洞的工具,自己沒有登入機制。這不是隱藏缺陷,是官方明講的使用邊界,但很容易被忽略。內網跑可以,別開到公網。

其他幾點:

  • 只有一個模組有量化評測。整份技術報告只有前面那張表。基礎設施掃描、MCP 審計、Agent 紅隊這三個模組,沒有任何檢出率或準確率數據。這是技術報告,不是經過評測的系統論文。
  • LLM 審計器的主要失效模式是過度回報。這是論文自己的話:「規則必須如此費力地說明不要回報什麼,本身就是一個徵兆。」他們花大量篇幅寫排除條件,就是在對抗模型的過度熱心。
  • 官方數字自己打架。元件覆蓋數在不同地方分別寫成 64、75、100+、130;漏洞規則數寫成 1,443、1,700+、1,888、1,900+、2,000+,另外 CLAUDE.md 裡還留著「589+ CVE 規則」。風險分類數也是,README 一處寫 Skill 掃描覆蓋 9 類,另一處寫 MCP 與 Skills 掃描覆蓋 14 類,而官方 MCP 掃描文件自己列出來的是 9 項,論文 Table 10 寫 10 種。四個數字互不相符。要引用的話建議標明版本與出處,別當成現行數字。
  • 越獄評測只描述儀器,沒有讀數。16 個資料集、7,248 條提示詞都列得很清楚,但論文沒有給出任何一個模型的實際攻擊成功率。想知道各家模型的安全防護實際做到什麼程度,這份報告幫不到你。

跟 SkillSpector、Uber ADR 差在哪?

差在覆蓋範圍與角色。這三個常被放在一起講,其實解決不同的問題。

工具定位覆蓋適合
AI-Infra-Guard全棧紅隊平台基礎設施+MCP+Skills+Agent+模型要一套掃完全部的團隊
NVIDIA SkillSpectorSkill 專用掃描器只掃 Agent Skills只在意裝進來的 Skill 乾不乾淨
Uber ADR執行期防禦系統Agent 執行中的攻擊攔截Agent 已上線、要即時擋

最大的分別是掃描時機。SkillSpector 與 AI-Infra-Guard 都是事前靜態審查,看程式碼有沒有問題;Uber ADR 是事中攔截,Agent 已經在跑了才動手。前兩者防的是你裝錯東西,後者防的是裝對了但被騙。

另外值得對照的是 Skill 的品質問題——安全和好不好用是兩回事。一個 Skill 可以完全沒有惡意程式碼,但寫得爛到讓你的 Agent 變笨。這兩種掃描解決的不是同一件事。

誰該裝?誰不用裝?

該裝:你的團隊在生產環境跑 Agent 平台,或者自架了 Ollama、vLLM、ComfyUI 這類服務。基礎設施掃描那一格對你最有價值,那是 CVE 比對,不靠模型判斷,最不容易出錯。

裝輕量版就好:你只是個人用戶,偶爾從市集裝 Skill。pip install aig-skill-scan 就夠,不用整套 Docker。

不用裝:你只用官方 App 聊天,不裝第三方 Skill、不接 MCP、不自架模型服務。這套工具的所有攻擊面你都沒有。

最後一句實話:這篇文章裡最有用的東西,可能不是這個工具本身,而是那張成績表透露的原則。任何用大模型當判斷核心的工具,你都該問一句它底下跑的是哪個模型——同樣的程式碼、同樣的規則,換個大腦,誤報率差 15.6 倍。這個問題適用的範圍,遠不只安全掃描器。

常見問題

AI-Infra-Guard 是免費的嗎?

是,Apache 2.0 授權完全免費。另有需要邀請碼的 Pro 版,優先給有提交 issue、PR 或參與社群的貢獻者。要注意授權條款要求保留 NOTICE 檔並標明來源,禁止改包成自有產品而不揭露出處。

它需要 API key 嗎?

看你用哪個模組。基礎設施掃描是規則比對,不需要模型。MCP 與 Skills 掃描、Agent 掃描、越獄評測都靠大模型判斷,要在設定裡填 base URL 與 API key。掃描費用等於模型的 token 費用,掃越多花越多。

掃出來的結果可以直接相信嗎?

不建議直接相信,尤其是靠模型判斷的那幾個模組。論文自己說 LLM 審計器的主要失效模式是過度回報,實測誤報率視基座模型從 1.2% 到 18.67% 不等。把它當成篩選器,把可疑的挑出來給人看,而不是當成最終判決。

SkillTrustBench 的 0.9848 是打敗了其他掃描工具嗎?

那張 0.9848 的表不是。它是 AI-Infra-Guard 自己的 Skill 掃描器在換用不同基座模型時的排行榜,第一名 Claude Opus 4.6 是模型名稱,不是競爭產品。不過 SkillTrustBench 官網另有一張外部掃描器榜(Skill Vetter 0.9659、Cisco Skill Scanner 0.9265、NVIDIA SkillSpector 0.9040),在那張榜上 AI-Infra-Guard 的分數確實較高——但那是它自己出的考卷,外部工具也是由出題方代跑,參考價值有限。

可以架在公司對外的伺服器上讓大家用嗎?

不可以。官方 README 明確寫著目前缺乏身份驗證機制,不應部署在公開網路上。內網或本機使用是它預期的場景。

資料來源

本文引用之數據皆註明版本與查核日期。文中「約 556 個評測案例」為本站依表格數值反推之推算,並非論文陳述,推算方法已於文中說明。

免責聲明:本文為技術工具介紹與公開資料整理,不構成任何投資建議或安全保證。開源軟體之使用風險由使用者自行承擔,安裝前請自行評估。AI 工具版本更新極快,文中數據截至 2026 年 8 月 22 日,實際功能與數值請以官方倉庫為準。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash