一個 11 萬星的 AI 技能包,首頁掛著「少寫約 54% 程式碼」。JetBrains 花了 246 美元、跑了 251 次代理試驗去驗這句話,結果最硬的那個數字,不在標題上。

一句話結論:ponytail 這個 AI skill 實測確實有效,但省到的是(成本 −10.3%,p=0.004)而不是招牌上的程式碼(−15.4%,p=0.088 不顯著);而且照 README 把 SKILL.md 丟進資料夾,10 個 session 裡它自動觸發 0 次。

我兩天前才寫過這隻 skill,為什麼今天要改口?

因為那篇用的是廠商自己的數字。

8 月 26 日我寫過 ponytail 這隻 AI 技能包,重點放在它「把自己的成績從 94% 砍到 54%」這件事上——一個開發者被人挑出 benchmark 有問題(issue #126),回頭自己重做、自己調低數字,這種誠實在開源圈不常見,值得寫。

但那篇的一句話結論寫的是「官方實測少寫約 54% 程式碼、省 20% 成本」。官方實測四個字,我當時標了,卻沒有第三方讀數可以對照。

今天補上了。JetBrains 在 2026 年 7 月 28 日發表了一份獨立實測,用 80 對配對任務跑同一隻 skill。他們的結論不是「這是假的」——恰恰相反,他們明說「我們並沒有推翻它在自己那套任務上的 −54%」。但離開它自己挑的題目之後,那個數字只剩下大約三成,而且統計上站不穩。

JetBrains 到底測了什麼?

測的是「同一個代理、同一批任務,裝了跟沒裝這隻 skill 的差別」。配置全部公開:

項目設定
測試框架Harbor 0.18(Docker 沙箱、任務驗證器、配對執行)
代理Claude Code 2.1.201,headless,兩組都鎖同一版本
模型claude-sonnet-5,medium reasoning effort
題庫SkillsBench 87 題,排除 7 題後用 80 對(1 題無法在本地沙箱跑、6 題兩組都同樣失敗)
對照組 A原生 Claude Code
實驗組 Bponytail v4.8.4,規則集逐位元組比照它自己 hook 產生的版本
總量251 次計費代理試驗,合計 246.09 美元

有一點要先講清楚,因為它會影響你怎麼讀後面的數字:實驗組 B 是「接近的模擬」而不是真的裝外掛跑。JetBrains 自己列了三處已知差異(沒有首次執行的狀態列提示、沒有子代理重新注入、規則集是在任務之後而非之前附加)。這種自己把減分項寫出來的做法,本身就是可信度訊號。

宣稱和實測,差多少?

差 2 到 7 倍,而且其中一項方向是反的。先看 ponytail 自己首頁掛的四個數字,對上 JetBrains 量到的:

指標官方宣稱JetBrains 實測剩下幾成統計顯著?
少寫程式碼−54%(最高 94%)−15.4%28.5%(p=0.088)
成本−20%−10.3%51.5%(p=0.004)
時間−27%−10.6%39.3%勉強(原文標 nominally significant)
token−22%口徑不同,見下

絕對量的部分:80 對任務裡,代理總共寫的 10,205 行變成 8,756 行,少了 1,449 行,也就是總量 −14.2%。這個數字跟「典型任務 −15.4%」不是同一回事——前者是總量,後者是逐題中位數。兩個都對,但不能混著引用。

為什麼「少寫 15.4% 程式碼」不能當結論?

因為它的 p 值是 0.088,過不了慣例的 0.05 門檻。JetBrains 原文的講法是:「這是我們幾個招牌數字裡最軟的一個。」

真正站得住的是成本那一條:典型任務便宜 10.3%,p=0.004,80 對裡有 46 對變便宜、34 對變貴。這是這個系列第一個明確為正的成本訊號。

一個 skill 的招牌賣點是「少寫程式碼」,結果三個月後最扎實的證據是「省了一成的帳單」。這兩件事在使用者腦中是同一件,在數據上不是。

輸入端更弱:重讀自己歷史的 token 掉 8.4%(p=0.138)、新讀入的 token 掉 3.9%(p=0.085),兩個都在雜訊範圍內。

還有一個很值得學的細節。ponytail 宣稱省 22% token,JetBrains 特意去翻它 benchmark 的原始碼,確認它的 token 是輸入+快取+輸出全部加總。如果拿自己「只算輸出」的數字去對它那個 −22%,原文的說法是「會讓我們的成績漂亮三倍」。分子和分母用不同的尺,是 benchmark 造假最常見、也最難被抓到的形態。

你那樣裝,它 10 個 session 觸發 0 次?

是。這是整份報告最實用的一段,也是最多人會踩的坑。

ponytail 的技能描述寫得很主動,叫模型在「任何寫程式、加功能、重構、修 bug、審查或設計程式碼的任務」上都用它。JetBrains 把 SKILL.md 放進技能資料夾,讓模型自己決定要不要用,結果是:

10 個 session 裡它自動啟用了 0 次。不是很少。是從來沒有。

技能就擺在那裡、模型看得見,但一次都沒有伸手去拿。JetBrains 說這不是 bug,而是「這就是為什麼這個工具是以外掛形式發佈、帶一個 SessionStart hook,不管你有沒有要求都把規則集注入進去」——那才是唯一會產生可測量效果的配置。

換句話說:裝法決定了它有沒有效,而不是它本身有沒有效。如果你是照 GitHub 首頁複製 SKILL.md 那條路走的,你手上那份「省 10% 成本」大概率等於零。這件事適用於整個 agent skills 生態,不只這一隻。

順帶一提遵守率:規則集要求模型在刻意走捷徑的那一行加上 ponytail: 註解,說明天花板和升級路徑。80 次試驗中,這件事發生了 1 次(1.25%)。原文的評語是:「梯子有被遵守,文書工作沒有。」

同一間公司測了三次,前兩隻是什麼下場?

一隻只剩宣稱的 13%,另一隻方向直接反過來。ponytail 是這個系列第一個真的省到錢的。

Skill宣稱JetBrains 實測結論
caveman少寫 65% 程式碼−8.5%剩 13.1%(差 7.65 倍)
rtk省 60–90% token成本 +7.6%方向反轉,反而更貴
ponytail少寫 54% 程式碼成本 −10.3%(p=0.004)系列首個扎實正結果

rtk 那一格要小心讀:它宣稱的是 token 少 60–90%,實測出來的是 成本 上升 7.6%。宣稱和實測本身就跨了兩個指標,這也是為什麼這類比較很難做——廠商挑哪個指標,本身就是結論的一部分。

宣稱換算器:廠商說省 X%,你該期待多少?

下面這個小工具,用上表三次實測的實際保留比例,把任何一個宣稱值換算成現實預期區間。輸入廠商掛在首頁的數字:

換算基準:caveman 保留 13.1%、ponytail 保留 28.5%、rtk 方向反轉。這是三個樣本的經驗區間,不是統計模型,也不保證適用於任何其他工具。

為什麼小樣本會給你一個完全相反的答案?

這是整份報告我認為最值錢的一段,而且跟 AI 工具無關——它是關於你怎麼讀任何一份實測。

JetBrains 跑完整的 80 對之前,先跑了一個 10 題的暖身測試。那 10 題告訴他們的故事是:ponytail 只少寫 3% 程式碼、成本反而貴 9.6%、任務平均分從 0.51 崩到 0.31。

「如果我們當時就發了,我們會寫出一篇非常不同、而且完全錯誤的文章。」

JetBrains,2026-07-28

同一隻工具、同一套框架、同一個模型,樣本從 10 加到 80,結論從「更貴而且品質崩掉」翻成「顯著省錢、品質測不出差別」。小樣本不是「不夠準」,是會給你一個方向相反的答案。

同一份報告裡還有一個誠實得罕見的自白:他們發現「大型建構任務可以砍到 −31%、本來就精簡的任務幾乎不動」這個規律之後,主動註明分桶門檻是看過數據才定的,所以「請把這張圖讀成效果落在哪裡的強烈提示,而不是一條測量出來的定律」。

那首頁掛的「100% safe」呢?

沒有被推翻,但也沒有被驗證——這兩件事不一樣,很多轉述會把它們寫成同一件。

JetBrains 主動聲明自己沒有能力驗這一條:「SkillsBench 的驗證器只評分任務有沒有完成。它們不是安全、驗證或無障礙測試套件。」品質那一格他們量到的是 80 對裡 9 題稍差、6 題稍好、65 題完全相同(81.2% 打和),而他們對這個結果的定性是:

「這是一個空結果,不是一張健康證明——這次執行從一開始就沒有足夠檢定力去證明兩者等價。」

「沒測到差別」和「沒有差別」中間隔著一整個統計學。這句話值得你在讀任何 AI 工具評測時抄下來。

所以到底該不該裝?

該裝,但要把期待值調到正確的位置,而且一定要用對的裝法。

  • 適合你,如果:你讓 AI 代理大量產生新功能、尤其是前端元件,而且你付的是 API 帳單。省一成的帳單長期是實錢,何況品質測不出退步。
  • 不適合你,如果:你的任務本來就精簡(修 bug、小改動、寫腳本)。實測顯示這類任務「典型移動量為零」。
  • 裝法是決定性的:走外掛 + SessionStart hook。複製 SKILL.md 進資料夾=實測 0 次自動觸發。
  • 不要拿 54% 去做預算:那是它在自己挑的 12 題(Haiku 4.5,n=4)上的平均。換一套題庫剩 28.5%,而且不顯著。

還有一個提醒。這隻 repo 我今天讀的時候是 114,708 顆星(2026-08-28 10:31 UTC,GitHub API),108 秒後再從網頁讀一次是 114,709 顆。星數這種數字寫進文章的當下就已經過期,它證明的是「很多人按過讚」,不是「它對你有效」。這兩件事之間,隔著 80 對配對任務和 246 美元。

常見問題

JetBrains 這份實測算是推翻了 ponytail 嗎?

不算,而且他們自己明講不算。原文寫「這並沒有推翻他們在自己那套任務上的 −54%」。兩邊用的模型不同(Haiku 4.5 對 claude-sonnet-5)、題庫不同、統計量不同(平均對中位數)。準確的講法是:離開 ponytail 自己挑的過度建構題目之後,效果剩下大約三成。

p=0.088 和 p=0.004 差在哪?

差在你能不能說「這不是碰巧」。慣例門檻是 0.05:p=0.004 的成本節省算是扎實訊號,p=0.088 的程式碼減少過不了門檻,只能說「觀察到了,但不排除是隨機」。這篇文章的重點就是這兩個數字被掛在了相反的位置——招牌講程式碼,證據在成本。

我把 SKILL.md 複製到技能資料夾就好了嗎?

不夠。JetBrains 實測 10 個 session 中它自動啟用 0 次。ponytail 設計成以外掛執行,用 SessionStart hook 自動注入規則集,那是唯一會產生可測量效果的配置。

這套判斷方法可以用在其他 AI skill 上嗎?

可以,三個問題就夠:一,這個數字是廠商自己的題庫還是第三方題庫?二,有沒有給 p 值或樣本數?三,官方指定的裝法是什麼?光是第三個問題,就能篩掉一大票「裝了等於沒裝」的情況。

最後

我兩天前把「−54%」寫進了一篇文章的結論裡,並標明那是官方數字。今天有第三方讀數了,我回來把它補上:真正經得起檢驗的是省一成帳單,不是省一半程式碼。

這不是 ponytail 的問題,它反而是我看過少數願意自己下修數字的專案。問題在於整個 AI 工具生態的預設狀態是「廠商出題、廠商評分、廠商發榜」星數不是效果自述不是實測。中間那段差距,得有人真的去花 246 美元跑一次。

原始資料:JetBrains 實測全文ponytail GitHub

本文所有數據截至 2026 年 8 月 28 日,來自 JetBrains 2026-07-28 公開實測報告與 ponytail 官方 GitHub 倉庫,經逐項核對原始頁面。AI 工具版本更新極快,數字可能已變動。本文為技術工具分析,不構成任何投資或採購建議。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash