重點先講:prompt cache 是綁模型的。你從 Sonnet 換到 Opus,那份快取不是搬過去,是直接作廢。下一輪要用約 1.25 倍的價錢重建。以 20 萬 token 的專案 context 換算,命中約 $0.10、重建約 $1.25,差 12.5 倍。所以「簡單的丟便宜模型、難的丟貴模型」這套省錢法,在同一份大 context 反覆使用時,有可能比全程用一個模型還貴。

截至 2026 年 9 月,網路上關於 Claude 模型「分層省錢」的教學很多。我翻過一輪,幾乎沒有一篇把前提講出來——不是他們寫錯,是那個前提藏在計費機制裡,不去翻 API 文件不會知道。

結果就是:一堆人照著做,覺得自己在省錢,帳單卻沒怎麼降。這篇補上那個前提。

先把 prompt cache 講成人話

你那份專案內容第一次送上去,要付全額。之後每一輪重送,系統認得出「這段我剛剛看過」,就只收你 0.1 倍的錢(Fable 5.1 更低,只要 2.5%)。這個機制叫 prompt cache。

這件事在 Claude Code 特別重要,因為它每一輪都會把整段對話重新送一次。一個來回十幾輪的任務,輸入是一路累積上去的。沒有快取的話,那個帳單會很難看。

狀態相對費率20 萬 token 以 Opus 5 費率($5/M)換算
第一次送(5 分鐘快取寫入)1.25 倍約 $1.25
第一次送(1 小時快取寫入)2 倍約 $2.00
後續命中快取0.1 倍約 $0.10
未使用快取(全價)1 倍約 $1.00
資料截點 2026-09-06。倍率取自 Anthropic 官方文件;金額為以 Opus 5 費率自行換算,非官方報價。

一個很重要的例外:Fable 5.1 的快取讀取只要輸入價的 2.5%,不是 10%。它的牌價是 $0.25/MTok,官方說比 Fable 5 便宜 75%。Anthropic 自己估,一般工作量的總成本因此降約 25%,複雜 coding 與高度代理式任務最多降約 45%。

這件事的意思是:Fable 5.1 的「貴」,很大一部分只出現在第一次送的時候。如果你的用法是同一份大 context 反覆跑,它的實際單位成本會比 $10/$50 這個牌價給人的印象低不少。這也讓下一段的結論更成立。換走模型,等於把這個折扣一起丟掉。

關鍵那一句:快取綁模型

每個模型有自己的一份快取,跨模型不共用。這句話的後果是:

你每換一次模型,那份 context 就要重新付一次全價建立快取。換得越勤,這筆錢付得越多次。

拿上面那張表算:命中是 $0.10,換模型後重建是 $1.25,差 12.5 倍。如果你在一個任務裡來回換三次模型,光是重建快取就多付了三次全價,而你原本以為自己在省錢。

那分層到底什麼時候有用?

這條不是要你別分層,是要你分清楚場景。

你的情境分層省不省為什麼
大量彼此獨立的短任務(分類、抽取、格式轉換)本來就沒有大 context 可以快取,換模型沒有沉沒成本
批次處理同一種小工作同上,而且可以直接用最便宜的那個
同一份大專案來回改(Claude Code 的典型用法)可能更貴每換一次就重建一次快取,抵銷掉單價差
長對話、逐步累積 context可能更貴同上,且 context 越大重建越貴

一句話判準:你的 context 大不大、會不會反覆用到?會,就別亂換;不會,分層照省。

比換模型更該先做的事:調 effort

effort 是同一個模型裡的旋鈕(low 到 max),意思是「同一個師傅,你叫他多想一下」。它跟換模型的差別很關鍵:調 effort 不會換掉模型,所以快取還在。

而且這個順序是官方自己給的:大多數工作從 Opus 5 開始,只有當 Opus 5 拉到更高 effort 之後還是做不完,才換 Fable 5.1。數字也撐得住。Anthropic 公布的 CursorBench 3.2 成績裡,Opus 5 開到最高 effort,分數落在 Fable 5 巔峰的 0.5% 以內,每題成本只有一半。

注意一個例外:在對話進行到一半時改動最上層的 effort 設定,一樣會讓 messages 快取失效。Fable 5.1 與 Opus 5 有一個 beta 做法叫「單則訊息 effort」(per-message effort),可以在對話中途改 effort 而不動到快取,需要中途調整的話走這條。

還有哪些動作會讓快取默默失效

快取是前綴比對:前面任何一個位元變了,後面全部作廢。所以這幾件事會讓你的快取命中率掉到零,而且不會有任何錯誤訊息:

  • system prompt 裡放了時間戳(例如每次都塞當下時間):每一次請求的前綴都不同
  • JSON 序列化時沒有固定鍵的順序:內容一樣,位元不一樣
  • 工具清單每次都在變。渲染順序是 tools → system → messages,工具變了後面全毀
  • 每次請求帶不同的 request ID 或隨機值進前綴

原則很簡單:穩定的東西放前面,會變的東西放最後

怎麼確認自己有沒有命中

如果你是走 API,回應的 usage 欄位會告訴你答案:

  • cache_read_input_tokens:從快取讀到的 token 數(便宜的那部分)
  • cache_creation_input_tokens:寫進快取的 token 數(貴的那部分)
  • input_tokens:完全沒快取到的 token 數(全價)

判準:如果在前綴相同的連續請求之間,cache_read_input_tokens 一直是 0,那就是有東西在默默讓你的快取失效。照上一節的清單去找。

換模型之外,還有四個槓桿

「換便宜的模型」通常是大家第一個想到的省錢法,但它其實是代價最大的一個,因為它同時動到快取。下面按「先做不痛的」排序:

順序槓桿大概能省多少代價
1把快取用對(穩定前綴、volatile 內容放最後)命中部分約 90%(Fable 5.1 約 97.5%)幾乎沒有,只是改寫法
2Batch API(非即時任務丟批次)50%不能即時拿到結果
3把 effort 調低視任務而定會影響品質,要實測
4換更便宜的模型單價最多 5 倍快取作廢,且能力下降
Batch API 折扣為 Anthropic 官方公布數字;其餘為相對比較,實際幅度依工作型態差異很大。

另外有個常被忽略的組合:把讀取量大、判斷簡單的雜活(讀檔、抽取、分類)交給 Haiku 4.5($1/$5),主線留在 Opus 5。但同一條紅線仍然成立。如果那些雜活跟主線共用同一份大 context,你就又回到重建快取的問題上了。要用這招,讓 worker 的 context 自成一套。

最後提醒一個判斷方式:算「每完成一件事」的成本,不要算「每次請求」的成本。一個比較便宜的模型如果要多來回三輪才做對,它並沒有比較便宜。

結論:先問「我在省什麼」

模型單價差五倍是檯面上的數字,很好比。快取重建的成本是檯面下的,不會出現在任何一張比價表上,但它會實際出現在你的帳單上。

所以在按下「換一個模型」之前,先問自己:我現在是真的需要不同的能力,還是只是想省那個單價?如果是後者,先把 effort 調低試試看。那不用換模型,快取留著。

延伸閱讀

資料來源

⚠️ 本文為公開資訊之中性整理與教育內容,不構成任何投資建議、要約或推介。文中倍率與費率取自上列官方文件,金額為以官方費率自行換算之示意,非官方報價;20 萬 token 的情境為本文自設,僅供比例參考。資料截點為 2026 年 9 月 6 日,AI 服務計費規則調整頻繁,實際費用請以你使用當天的官方頁面與帳單為準。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash