重點先講:prompt cache 是綁模型的。你從 Sonnet 換到 Opus,那份快取不是搬過去,是直接作廢。下一輪要用約 1.25 倍的價錢重建。以 20 萬 token 的專案 context 換算,命中約 $0.10、重建約 $1.25,差 12.5 倍。所以「簡單的丟便宜模型、難的丟貴模型」這套省錢法,在同一份大 context 反覆使用時,有可能比全程用一個模型還貴。
截至 2026 年 9 月,網路上關於 Claude 模型「分層省錢」的教學很多。我翻過一輪,幾乎沒有一篇把前提講出來——不是他們寫錯,是那個前提藏在計費機制裡,不去翻 API 文件不會知道。
結果就是:一堆人照著做,覺得自己在省錢,帳單卻沒怎麼降。這篇補上那個前提。
先把 prompt cache 講成人話
你那份專案內容第一次送上去,要付全額。之後每一輪重送,系統認得出「這段我剛剛看過」,就只收你 0.1 倍的錢(Fable 5.1 更低,只要 2.5%)。這個機制叫 prompt cache。
這件事在 Claude Code 特別重要,因為它每一輪都會把整段對話重新送一次。一個來回十幾輪的任務,輸入是一路累積上去的。沒有快取的話,那個帳單會很難看。
| 狀態 | 相對費率 | 20 萬 token 以 Opus 5 費率($5/M)換算 |
|---|---|---|
| 第一次送(5 分鐘快取寫入) | 1.25 倍 | 約 $1.25 |
| 第一次送(1 小時快取寫入) | 2 倍 | 約 $2.00 |
| 後續命中快取 | 0.1 倍 | 約 $0.10 |
| 未使用快取(全價) | 1 倍 | 約 $1.00 |
一個很重要的例外:Fable 5.1 的快取讀取只要輸入價的 2.5%,不是 10%。它的牌價是 $0.25/MTok,官方說比 Fable 5 便宜 75%。Anthropic 自己估,一般工作量的總成本因此降約 25%,複雜 coding 與高度代理式任務最多降約 45%。
這件事的意思是:Fable 5.1 的「貴」,很大一部分只出現在第一次送的時候。如果你的用法是同一份大 context 反覆跑,它的實際單位成本會比 $10/$50 這個牌價給人的印象低不少。這也讓下一段的結論更成立。換走模型,等於把這個折扣一起丟掉。
關鍵那一句:快取綁模型
每個模型有自己的一份快取,跨模型不共用。這句話的後果是:
你每換一次模型,那份 context 就要重新付一次全價建立快取。換得越勤,這筆錢付得越多次。
拿上面那張表算:命中是 $0.10,換模型後重建是 $1.25,差 12.5 倍。如果你在一個任務裡來回換三次模型,光是重建快取就多付了三次全價,而你原本以為自己在省錢。
那分層到底什麼時候有用?
這條不是要你別分層,是要你分清楚場景。
| 你的情境 | 分層省不省 | 為什麼 |
|---|---|---|
| 大量彼此獨立的短任務(分類、抽取、格式轉換) | 省 | 本來就沒有大 context 可以快取,換模型沒有沉沒成本 |
| 批次處理同一種小工作 | 省 | 同上,而且可以直接用最便宜的那個 |
| 同一份大專案來回改(Claude Code 的典型用法) | 可能更貴 | 每換一次就重建一次快取,抵銷掉單價差 |
| 長對話、逐步累積 context | 可能更貴 | 同上,且 context 越大重建越貴 |
一句話判準:你的 context 大不大、會不會反覆用到?會,就別亂換;不會,分層照省。
比換模型更該先做的事:調 effort
effort 是同一個模型裡的旋鈕(low 到 max),意思是「同一個師傅,你叫他多想一下」。它跟換模型的差別很關鍵:調 effort 不會換掉模型,所以快取還在。
而且這個順序是官方自己給的:大多數工作從 Opus 5 開始,只有當 Opus 5 拉到更高 effort 之後還是做不完,才換 Fable 5.1。數字也撐得住。Anthropic 公布的 CursorBench 3.2 成績裡,Opus 5 開到最高 effort,分數落在 Fable 5 巔峰的 0.5% 以內,每題成本只有一半。
注意一個例外:在對話進行到一半時改動最上層的 effort 設定,一樣會讓 messages 快取失效。Fable 5.1 與 Opus 5 有一個 beta 做法叫「單則訊息 effort」(per-message effort),可以在對話中途改 effort 而不動到快取,需要中途調整的話走這條。
還有哪些動作會讓快取默默失效
快取是前綴比對:前面任何一個位元變了,後面全部作廢。所以這幾件事會讓你的快取命中率掉到零,而且不會有任何錯誤訊息:
- system prompt 裡放了時間戳(例如每次都塞當下時間):每一次請求的前綴都不同
- JSON 序列化時沒有固定鍵的順序:內容一樣,位元不一樣
- 工具清單每次都在變。渲染順序是 tools → system → messages,工具變了後面全毀
- 每次請求帶不同的 request ID 或隨機值進前綴
原則很簡單:穩定的東西放前面,會變的東西放最後。
怎麼確認自己有沒有命中
如果你是走 API,回應的 usage 欄位會告訴你答案:
cache_read_input_tokens:從快取讀到的 token 數(便宜的那部分)cache_creation_input_tokens:寫進快取的 token 數(貴的那部分)input_tokens:完全沒快取到的 token 數(全價)
判準:如果在前綴相同的連續請求之間,cache_read_input_tokens 一直是 0,那就是有東西在默默讓你的快取失效。照上一節的清單去找。
換模型之外,還有四個槓桿
「換便宜的模型」通常是大家第一個想到的省錢法,但它其實是代價最大的一個,因為它同時動到快取。下面按「先做不痛的」排序:
| 順序 | 槓桿 | 大概能省多少 | 代價 |
|---|---|---|---|
| 1 | 把快取用對(穩定前綴、volatile 內容放最後) | 命中部分約 90%(Fable 5.1 約 97.5%) | 幾乎沒有,只是改寫法 |
| 2 | Batch API(非即時任務丟批次) | 50% | 不能即時拿到結果 |
| 3 | 把 effort 調低 | 視任務而定 | 會影響品質,要實測 |
| 4 | 換更便宜的模型 | 單價最多 5 倍 | 快取作廢,且能力下降 |
另外有個常被忽略的組合:把讀取量大、判斷簡單的雜活(讀檔、抽取、分類)交給 Haiku 4.5($1/$5),主線留在 Opus 5。但同一條紅線仍然成立。如果那些雜活跟主線共用同一份大 context,你就又回到重建快取的問題上了。要用這招,讓 worker 的 context 自成一套。
最後提醒一個判斷方式:算「每完成一件事」的成本,不要算「每次請求」的成本。一個比較便宜的模型如果要多來回三輪才做對,它並沒有比較便宜。
結論:先問「我在省什麼」
模型單價差五倍是檯面上的數字,很好比。快取重建的成本是檯面下的,不會出現在任何一張比價表上,但它會實際出現在你的帳單上。
所以在按下「換一個模型」之前,先問自己:我現在是真的需要不同的能力,還是只是想省那個單價?如果是後者,先把 effort 調低試試看。那不用換模型,快取留著。
延伸閱讀
- Claude Fable 5.1、Opus 5、Sonnet 5 差在哪?完整比較表
- Fable 在 Pro 與 Max 方案怎麼算?usage credits 完整拆解
- GPT-6 Astra 開源嗎?同一週、同一個價,Mythos 比 Fable 高 5.1 分
資料來源
- Anthropic 官方模型文件 — Claude Fable 5.1(快取費率原始出處:cache read $0.25/MTok、5m write $12.50、1h write $20、Batch 50% off)
- Anthropic — Introducing Claude Fable 5.1 and Mythos 5.1(快取降價 75%、總成本降 25%~45% 的官方估計)
- Anthropic — Prompt caching 官方文件(前綴比對機制、usage 欄位)
- Anthropic 官方定價頁(各模型 API 費率)
- Claude Code 官方文件 — Model configuration(模型別名與定位)
- Anthropic — Introducing Claude Opus 5(CursorBench 3.2 成績)
- Anthropic — Introducing Claude Sonnet 5(Sonnet 5 定價與定位)
- Claude 說明中心 — Claude Fable models on your plan(方案計費規則)
- Anthropic — Messages API 參考(usage 回傳欄位定義)
- Anthropic — Extended thinking / effort 文件(effort 等級與適用模型)
⚠️ 本文為公開資訊之中性整理與教育內容,不構成任何投資建議、要約或推介。文中倍率與費率取自上列官方文件,金額為以官方費率自行換算之示意,非官方報價;20 萬 token 的情境為本文自設,僅供比例參考。資料截點為 2026 年 9 月 6 日,AI 服務計費規則調整頻繁,實際費用請以你使用當天的官方頁面與帳單為準。






發表迴響