一個 11 萬星的 AI 技能包,首頁掛著「少寫約 54% 程式碼」。JetBrains 花了 246 美元、跑了 251 次代理試驗去驗這句話,結果最硬的那個數字,不在標題上。
一句話結論:ponytail 這個 AI skill 實測確實有效,但省到的是錢(成本 −10.3%,p=0.004)而不是招牌上的程式碼(−15.4%,p=0.088 不顯著);而且照 README 把 SKILL.md 丟進資料夾,10 個 session 裡它自動觸發 0 次。
我兩天前才寫過這隻 skill,為什麼今天要改口?
因為那篇用的是廠商自己的數字。
8 月 26 日我寫過 ponytail 這隻 AI 技能包,重點放在它「把自己的成績從 94% 砍到 54%」這件事上——一個開發者被人挑出 benchmark 有問題(issue #126),回頭自己重做、自己調低數字,這種誠實在開源圈不常見,值得寫。
但那篇的一句話結論寫的是「官方實測少寫約 54% 程式碼、省 20% 成本」。官方實測四個字,我當時標了,卻沒有第三方讀數可以對照。
今天補上了。JetBrains 在 2026 年 7 月 28 日發表了一份獨立實測,用 80 對配對任務跑同一隻 skill。他們的結論不是「這是假的」——恰恰相反,他們明說「我們並沒有推翻它在自己那套任務上的 −54%」。但離開它自己挑的題目之後,那個數字只剩下大約三成,而且統計上站不穩。
JetBrains 到底測了什麼?
測的是「同一個代理、同一批任務,裝了跟沒裝這隻 skill 的差別」。配置全部公開:
| 項目 | 設定 |
|---|---|
| 測試框架 | Harbor 0.18(Docker 沙箱、任務驗證器、配對執行) |
| 代理 | Claude Code 2.1.201,headless,兩組都鎖同一版本 |
| 模型 | claude-sonnet-5,medium reasoning effort |
| 題庫 | SkillsBench 87 題,排除 7 題後用 80 對(1 題無法在本地沙箱跑、6 題兩組都同樣失敗) |
| 對照組 A | 原生 Claude Code |
| 實驗組 B | ponytail v4.8.4,規則集逐位元組比照它自己 hook 產生的版本 |
| 總量 | 251 次計費代理試驗,合計 246.09 美元 |
有一點要先講清楚,因為它會影響你怎麼讀後面的數字:實驗組 B 是「接近的模擬」而不是真的裝外掛跑。JetBrains 自己列了三處已知差異(沒有首次執行的狀態列提示、沒有子代理重新注入、規則集是在任務之後而非之前附加)。這種自己把減分項寫出來的做法,本身就是可信度訊號。
宣稱和實測,差多少?
差 2 到 7 倍,而且其中一項方向是反的。先看 ponytail 自己首頁掛的四個數字,對上 JetBrains 量到的:
| 指標 | 官方宣稱 | JetBrains 實測 | 剩下幾成 | 統計顯著? |
|---|---|---|---|---|
| 少寫程式碼 | −54%(最高 94%) | −15.4% | 28.5% | 否(p=0.088) |
| 成本 | −20% | −10.3% | 51.5% | 是(p=0.004) |
| 時間 | −27% | −10.6% | 39.3% | 勉強(原文標 nominally significant) |
| token | −22% | 口徑不同,見下 | — | 否 |
絕對量的部分:80 對任務裡,代理總共寫的 10,205 行變成 8,756 行,少了 1,449 行,也就是總量 −14.2%。這個數字跟「典型任務 −15.4%」不是同一回事——前者是總量,後者是逐題中位數。兩個都對,但不能混著引用。
為什麼「少寫 15.4% 程式碼」不能當結論?
因為它的 p 值是 0.088,過不了慣例的 0.05 門檻。JetBrains 原文的講法是:「這是我們幾個招牌數字裡最軟的一個。」
真正站得住的是成本那一條:典型任務便宜 10.3%,p=0.004,80 對裡有 46 對變便宜、34 對變貴。這是這個系列第一個明確為正的成本訊號。
一個 skill 的招牌賣點是「少寫程式碼」,結果三個月後最扎實的證據是「省了一成的帳單」。這兩件事在使用者腦中是同一件,在數據上不是。
輸入端更弱:重讀自己歷史的 token 掉 8.4%(p=0.138)、新讀入的 token 掉 3.9%(p=0.085),兩個都在雜訊範圍內。
還有一個很值得學的細節。ponytail 宣稱省 22% token,JetBrains 特意去翻它 benchmark 的原始碼,確認它的 token 是輸入+快取+輸出全部加總。如果拿自己「只算輸出」的數字去對它那個 −22%,原文的說法是「會讓我們的成績漂亮三倍」。分子和分母用不同的尺,是 benchmark 造假最常見、也最難被抓到的形態。
你那樣裝,它 10 個 session 觸發 0 次?
是。這是整份報告最實用的一段,也是最多人會踩的坑。
ponytail 的技能描述寫得很主動,叫模型在「任何寫程式、加功能、重構、修 bug、審查或設計程式碼的任務」上都用它。JetBrains 把 SKILL.md 放進技能資料夾,讓模型自己決定要不要用,結果是:
10 個 session 裡它自動啟用了 0 次。不是很少。是從來沒有。
技能就擺在那裡、模型看得見,但一次都沒有伸手去拿。JetBrains 說這不是 bug,而是「這就是為什麼這個工具是以外掛形式發佈、帶一個 SessionStart hook,不管你有沒有要求都把規則集注入進去」——那才是唯一會產生可測量效果的配置。
換句話說:裝法決定了它有沒有效,而不是它本身有沒有效。如果你是照 GitHub 首頁複製 SKILL.md 那條路走的,你手上那份「省 10% 成本」大概率等於零。這件事適用於整個 agent skills 生態,不只這一隻。
順帶一提遵守率:規則集要求模型在刻意走捷徑的那一行加上 ponytail: 註解,說明天花板和升級路徑。80 次試驗中,這件事發生了 1 次(1.25%)。原文的評語是:「梯子有被遵守,文書工作沒有。」
同一間公司測了三次,前兩隻是什麼下場?
一隻只剩宣稱的 13%,另一隻方向直接反過來。ponytail 是這個系列第一個真的省到錢的。
| Skill | 宣稱 | JetBrains 實測 | 結論 |
|---|---|---|---|
| caveman | 少寫 65% 程式碼 | −8.5% | 剩 13.1%(差 7.65 倍) |
| rtk | 省 60–90% token | 成本 +7.6% | 方向反轉,反而更貴 |
| ponytail | 少寫 54% 程式碼 | 成本 −10.3%(p=0.004) | 系列首個扎實正結果 |
rtk 那一格要小心讀:它宣稱的是 token 少 60–90%,實測出來的是 成本 上升 7.6%。宣稱和實測本身就跨了兩個指標,這也是為什麼這類比較很難做——廠商挑哪個指標,本身就是結論的一部分。
宣稱換算器:廠商說省 X%,你該期待多少?
下面這個小工具,用上表三次實測的實際保留比例,把任何一個宣稱值換算成現實預期區間。輸入廠商掛在首頁的數字:
換算基準:caveman 保留 13.1%、ponytail 保留 28.5%、rtk 方向反轉。這是三個樣本的經驗區間,不是統計模型,也不保證適用於任何其他工具。
為什麼小樣本會給你一個完全相反的答案?
這是整份報告我認為最值錢的一段,而且跟 AI 工具無關——它是關於你怎麼讀任何一份實測。
JetBrains 跑完整的 80 對之前,先跑了一個 10 題的暖身測試。那 10 題告訴他們的故事是:ponytail 只少寫 3% 程式碼、成本反而貴 9.6%、任務平均分從 0.51 崩到 0.31。
「如果我們當時就發了,我們會寫出一篇非常不同、而且完全錯誤的文章。」
JetBrains,2026-07-28
同一隻工具、同一套框架、同一個模型,樣本從 10 加到 80,結論從「更貴而且品質崩掉」翻成「顯著省錢、品質測不出差別」。小樣本不是「不夠準」,是會給你一個方向相反的答案。
同一份報告裡還有一個誠實得罕見的自白:他們發現「大型建構任務可以砍到 −31%、本來就精簡的任務幾乎不動」這個規律之後,主動註明分桶門檻是看過數據才定的,所以「請把這張圖讀成效果落在哪裡的強烈提示,而不是一條測量出來的定律」。
那首頁掛的「100% safe」呢?
沒有被推翻,但也沒有被驗證——這兩件事不一樣,很多轉述會把它們寫成同一件。
JetBrains 主動聲明自己沒有能力驗這一條:「SkillsBench 的驗證器只評分任務有沒有完成。它們不是安全、驗證或無障礙測試套件。」品質那一格他們量到的是 80 對裡 9 題稍差、6 題稍好、65 題完全相同(81.2% 打和),而他們對這個結果的定性是:
「這是一個空結果,不是一張健康證明——這次執行從一開始就沒有足夠檢定力去證明兩者等價。」
「沒測到差別」和「沒有差別」中間隔著一整個統計學。這句話值得你在讀任何 AI 工具評測時抄下來。
所以到底該不該裝?
該裝,但要把期待值調到正確的位置,而且一定要用對的裝法。
- 適合你,如果:你讓 AI 代理大量產生新功能、尤其是前端元件,而且你付的是 API 帳單。省一成的帳單長期是實錢,何況品質測不出退步。
- 不適合你,如果:你的任務本來就精簡(修 bug、小改動、寫腳本)。實測顯示這類任務「典型移動量為零」。
- 裝法是決定性的:走外掛 + SessionStart hook。複製 SKILL.md 進資料夾=實測 0 次自動觸發。
- 不要拿 54% 去做預算:那是它在自己挑的 12 題(Haiku 4.5,n=4)上的平均。換一套題庫剩 28.5%,而且不顯著。
還有一個提醒。這隻 repo 我今天讀的時候是 114,708 顆星(2026-08-28 10:31 UTC,GitHub API),108 秒後再從網頁讀一次是 114,709 顆。星數這種數字寫進文章的當下就已經過期,它證明的是「很多人按過讚」,不是「它對你有效」。這兩件事之間,隔著 80 對配對任務和 246 美元。
常見問題
JetBrains 這份實測算是推翻了 ponytail 嗎?
不算,而且他們自己明講不算。原文寫「這並沒有推翻他們在自己那套任務上的 −54%」。兩邊用的模型不同(Haiku 4.5 對 claude-sonnet-5)、題庫不同、統計量不同(平均對中位數)。準確的講法是:離開 ponytail 自己挑的過度建構題目之後,效果剩下大約三成。
p=0.088 和 p=0.004 差在哪?
差在你能不能說「這不是碰巧」。慣例門檻是 0.05:p=0.004 的成本節省算是扎實訊號,p=0.088 的程式碼減少過不了門檻,只能說「觀察到了,但不排除是隨機」。這篇文章的重點就是這兩個數字被掛在了相反的位置——招牌講程式碼,證據在成本。
我把 SKILL.md 複製到技能資料夾就好了嗎?
不夠。JetBrains 實測 10 個 session 中它自動啟用 0 次。ponytail 設計成以外掛執行,用 SessionStart hook 自動注入規則集,那是唯一會產生可測量效果的配置。
這套判斷方法可以用在其他 AI skill 上嗎?
可以,三個問題就夠:一,這個數字是廠商自己的題庫還是第三方題庫?二,有沒有給 p 值或樣本數?三,官方指定的裝法是什麼?光是第三個問題,就能篩掉一大票「裝了等於沒裝」的情況。
最後
我兩天前把「−54%」寫進了一篇文章的結論裡,並標明那是官方數字。今天有第三方讀數了,我回來把它補上:真正經得起檢驗的是省一成帳單,不是省一半程式碼。
這不是 ponytail 的問題,它反而是我看過少數願意自己下修數字的專案。問題在於整個 AI 工具生態的預設狀態是「廠商出題、廠商評分、廠商發榜」。星數不是效果,自述不是實測。中間那段差距,得有人真的去花 246 美元跑一次。
原始資料:JetBrains 實測全文|ponytail GitHub
本文所有數據截至 2026 年 8 月 28 日,來自 JetBrains 2026-07-28 公開實測報告與 ponytail 官方 GitHub 倉庫,經逐項核對原始頁面。AI 工具版本更新極快,數字可能已變動。本文為技術工具分析,不構成任何投資或採購建議。




發表迴響