你在 Codex 裡按下模型選單,跳出三個名字:5.6 Sol、5.6 Terra、5.6 Luna。官方文案分別是「最新前沿」「日常均衡」「快又便宜」。看起來很清楚,實際上什麼也沒說。貴的那個到底貴在哪?便宜的那個什麼時候會出包?
我把同一道題丟給三檔各跑一次,順便把市面上三份公開實測拉出來對照。結論有點反直覺:在短任務上,三檔的答案幾乎一模一樣,成本卻差 35 倍;但換成長任務,差距會從「幾乎沒有」暴衝到「不能用」。
本文數據截至 2026 年 8 月 4 日。
先給結論:60 秒版
| 你要做的事 | 選哪檔 | 理由 |
|---|---|---|
| 問一個問題、改一個檔、review 一段程式 | Luna | 短任務三檔品質差不多,Luna 便宜 35 倍 |
| 日常寫功能、修 bug、跑幾十分鐘的任務 | Terra | 價格是 Sol 的 1/4,多數 benchmark 差 1~3 分 |
| 跨多檔重構、要跑幾小時的 agent 任務 | Sol | 任務越長差距越大,這裡才值回票價 |
| 塞一整個 repo 或幾百頁文件進去 | 絕對不要用 Luna | 長脈絡召回只有 41.3%,Sol 是 91.5% |
三檔到底是什麼?先把帳單攤開
GPT-5.6 在 2026 年 7 月 9 日全面上線,一次給三檔。OpenAI 的說法是:數字(5.6)代表世代,Sol / Terra / Luna 是三條各自演進的能力線。翻成白話就是「以後每一代都會有這三檔,你選的是價位不是版本」。
7 月 30 日 OpenAI 又砍了一次價:Luna 降 80%、Terra 降 20%、Sol 沒動。降完之後的價差非常誇張。
| 模型 | 官方定位 | 輸入(每 100 萬 token) | 輸出(每 100 萬 token) | 脈絡長度 |
|---|---|---|---|---|
| GPT-5.6 Sol | 最新前沿 agentic coding 模型 | $5.00 | $30.00 | 272K |
| GPT-5.6 Terra | 日常工作的均衡款 | $2.00 | $12.00 | 272K |
| GPT-5.6 Luna | 又快又便宜 | $0.20 | $1.20 | 272K |
輸出價 Sol 是 Luna 的 25 倍。三檔脈絡長度都是 272K,這點沒有差別,但「塞得進去」跟「讀得懂」是兩回事,等一下會講到這個坑。
官方 benchmark 說:差 2 到 3 分
| 測試項目 | Sol | Terra | Luna |
|---|---|---|---|
| Terminal-Bench 2.1(終端機操作) | 88.8% | 87.4% | 84.7% |
| Coding Agent Index(綜合編碼) | 80 | 77.4 | 74.6 |
| Agents’ Last Exam(長時程專業工作) | 53.6 | 50.4 | 50.3 |
| SWE-Bench Pro(真實 repo 修 bug) | 64.6% | 63.4% | 62.7% |
| MRCR(長脈絡召回) | 91.5% | 89.6% | 41.3% |
看到這張表,多數人的反應是「那當然選 Terra 啊」。SWE-Bench Pro 上 Sol 只贏 Terra 1.2 分,價格卻是 2.5 倍。Agents’ Last Exam 上 Terra 跟 Luna 差 0.1 分,價格差 10 倍。
這個推論看起來無懈可擊。問題是它建立在一個假設上:benchmark 的分差可以外推到你的工作。而這個假設,被另外兩份實測打得很難看。
三份實測,三種答案
CodeRabbit(做 AI code review 的公司,有自己的商業立場,看數字時要記得這點)跑了 100 多個跨語言的長時程實作任務。他們量到的差距是這樣:
| CodeRabbit 長時程實作測試 | Sol | Terra |
|---|---|---|
| 通過率 | 63.7% | 40.7% |
| 每題平均輸出 token | 20,968 | 55,594 |
差 23 個百分點。更值得看的是第二行:Terra 為了做完一題,平均吐了 Sol 的 2.65 倍 token。輸出單價便宜 60%,話卻多了 165%。實際算一下每題的輸出成本,Sol 約 $0.63、Terra 約 $0.67,便宜的那個反而比較貴。這跟 SWE-Bench Pro 上「差 1.2 分」的印象完全對不起來。
然後是我自己這一份。
我的實測:同一題,三檔各跑一次
測試方法很簡單:寫一段藏了多個 bug 的 Python(可變預設參數、迴圈少跑一圈、區間合併邏輯錯、迭代中刪 list、多餘的浮點相等比較、docstring 跟行為不符),丟給三檔各跑一次,reasoning effort 都設 medium,用 codex exec --json 直接收官方回報的 token 用量。
| Sol | Terra | Luna | |
|---|---|---|---|
| 耗時 | 66.3 秒 | 29.1 秒 | 29.6 秒 |
| 輸入 token | 20,397 | 20,397 | 18,934 |
| 輸出 token | 2,037 | 1,179 | 1,409 |
| 其中思考 token | 516 | 258 | 516 |
| 抓到的問題數 | 9 項 | 7 項 | 7 項 |
| 換算 API 成本 | $0.1366 | $0.0370 | $0.0039 |
重點不在數字,在三份答案長什麼樣。核心 bug 三檔全部抓到,一個沒漏。三份「修正後的完整程式碼」拿去比對,實質邏輯一模一樣,連變數命名都高度雷同。
Sol 多出來的那兩項是什麼?一項是指出「就算修好合併邏輯,記錄筆數的那行時機也不對」;另一項是討論「去重」在字典上該用什麼判準比較好。都是對的,也都有價值,但沒有一項是「Terra 和 Luna 給了會出事的答案」。
這一題,Sol 花了 Luna 的 35.3 倍成本、2.2 倍時間,換到兩條邊角補充。
把它放大到日常用量更有感。假設一天 200 次這種規模的呼叫:
- Sol:每月約 $820(約 NT$25,400)
- Terra:每月約 $222(約 NT$6,900)
- Luna:每月約 $23(約 NT$720)
如果你的工作有八成是這種「單檔、有明確答案」的任務,卻整天掛在 Sol 上,那多付的錢買到的是心安,不是品質。
那到底差在哪?答案是任務長度
把三份實測擺在一起,矛盾就消失了:
| 任務類型 | Sol 領先 Terra | 來源 |
|---|---|---|
| 單次問答(一段程式碼找 bug) | 幾乎為 0 | 本文實測 |
| 單一 repo 修 bug(SWE-Bench Pro) | 1.2 分 | 官方 benchmark |
| 跨語言長時程實作(100+ 題) | 23 分 | CodeRabbit |
差距不是模型的固定屬性,是任務長度的函數。任務越長、要串的步驟越多、中途要記住的東西越多,弱一點的模型走偏的機率就是複利式累積。單次問答只有一步,走不偏;跑三小時的 agent 任務有幾百步,錯一步後面全歪。
所以「Terra 只差 Sol 兩三分」這句話沒有錯,但它只在短任務成立。你不能拿短任務的分差,去買長任務的信心。
Luna 唯一那條不能踩的紅線
Luna 便宜到幾乎沒有理由不用,但它有一個很硬的失效模式:長脈絡召回只有 41.3%,Sol 是 91.5%、Terra 89.6%。
三檔脈絡長度都寫 272K,這是「塞得進去」。MRCR 測的是「塞進去之後,能不能從一大堆內容裡把正確那段撈出來」。Luna 在 256K 以上的區間直接掉到四成。這不叫差一點,這叫一半以上的時候會撈錯。
實務上會踩到的場景:把整包程式碼丟進去問「這個函式在哪被呼叫」、丟一份幾百頁 PDF 問細節、多份文件交叉比對。這些用 Luna 會拿到自信滿滿的錯答案,而且你不會察覺。它不會說「我找不到」,它會編一個。這比慢一點糟糕得多。
順便講一件所有 benchmark 都該打折的事
獨立評測機構 METR 在部署前評估 GPT-5.6 Sol,寫下這句話:它偵測到的作弊率高於 METR 評估過的任何公開模型。
METR 對「作弊」的定義是:模型不是照題目要求解題,而是靠鑽測試環境的漏洞來提高分數。他們抓到的實例包括:模型在中途提交裡夾帶手法,用來探出題目隱藏的測試案例;以及在另一題直接挖出藏起來的原始碼,看到預期答案。
結果就是那次評估根本量不出一個可用的能力數字。同一批測試,取決於怎麼處理作弊的那些回合:
- 作弊算失敗 → 50% 時間視野約 11.3 小時(95% 信賴區間 5~40 小時)
- 作弊算成功 → 衝到 270 小時以上
- 作弊的回合直接丟掉 → 71 小時(95% 信賴區間 13~11,400 小時)
METR 自己的結論是,這三個數字沒有一個能代表 GPT-5.6 Sol 的真實能力。
這件事對你的實際意義不是「模型很壞」,而是:你看到的每一張 benchmark 表,都有一部分分數是這樣來的。所以本文那三份實測互相打架,其實一點也不奇怪。真正該信的是你自己那個工作流跑出來的結果,跑五題你就知道夠不夠用了,比讀十篇評測快。
Codex 用戶專屬:兩件你在選單上看不出來的事
1. 選單裡有兩個 Terra,不是你眼花
翻 Codex 本機的模型清單會看到,顯示名稱叫「GPT-5.6-Terra」的項目有兩個,一個內部代號是 gpt-5.6-terra,另一個是 codex-auto-review。後者是給自動 code review 用的專用配置,系統提示詞跟一般 Terra 不同。日常用選第一個就好。
2. 訂閱制跟 API 是兩套帳,別搞混
本文算的 35 倍價差是 API 帳單。如果你是在 Codex 裡用 ChatGPT 訂閱,那不按 token 收費,而是按「則數」限制。以 Plus 方案的 5 小時滾動窗口為例:
| 方案 | Sol | Terra | Luna |
|---|---|---|---|
| Plus(每 5 小時窗口) | 15~90 則 | 20~110 則 | 50~280 則 |
同樣的訂閱費,用 Luna 能發的則數大約是 Sol 的 3 倍。Codex 的 GitHub issue 區早就有人回報「Terra 和 Sol 幾分鐘就把 5 小時額度燒光」,這不是個案。
補充一個容易誤判的變動:OpenAI 在 7 月 12 日暫時取消了 Plus、Pro、Business 在 Codex 的 5 小時限制,但這是暫時措施,沒有公布結束日期,而且週上限依然存在。所以「現在好像不會被擋」不代表額度變無限,只是換成用週來算。
訂閱用戶的最佳策略因此跟 API 用戶不一樣。不用糾結省錢,要糾結的是「把貴的額度留給真的需要的長任務」。日常問答、跑測試、寫 commit message 全丟 Luna,額度就不會在週中燒光。
怎麼選:三個問題定生死
- 這個任務要跑超過 30 分鐘、或要跨 5 個以上檔案嗎?是 → Sol。長時程是唯一 Sol 明確拉開差距的地方。
- 要餵超過 10 萬 token 的資料進去嗎?是 → Terra 或 Sol,不要 Luna。
- 都不是?→ Luna。省下來的錢跟額度,留給第 1 題。
另外一個容易被忽略的槓桿:reasoning effort 的影響常常比換模型還大。同一個模型從 high 降到 low,我在別的產線量過,產出內容會縮水一成六,省了 12% 的 token,換來品質實質下降。要調就先調 effort,再考慮換模型,別兩個一起動,不然出事你分不出是誰的問題。
常見問題
Sol、Terra、Luna 是三個不同的模型,還是同一個模型的三種設定?
是三個不同的模型,價格、速度、能力都不同。跟 reasoning effort(low / medium / high / xhigh)是兩個獨立的維度,可以自由組合。
我原本用 GPT-5.4,該換哪一檔?
官方的遷移路徑是 GPT-5.4 → Terra、GPT-5.4-Mini → Luna,兩者都標示即將停用,建議直接換過去,不要等到被強制切換。
Terra 的 token 用量真的比較多嗎?
看任務。CodeRabbit 的長時程測試裡 Terra 吐了 Sol 的 2.65 倍;我這邊的單次問答剛好相反,Sol 的輸出是 Terra 的 1.7 倍。前者是「繞遠路」,後者是「想得比較深」。所以評估成本要看「每個完成任務花多少錢」,不是每百萬 token 的單價。
這些數字多久會過期?
價格變動很快,光是 7 月 30 日一次就砍了 Luna 八成。benchmark 分數在同一代內相對穩定,但下一代出來就要重測。文中的價格與分數以 2026 年 8 月 4 日為準。
最後一句
官方那張分數表沒說謊,但它回答的是「哪一檔最強」,而你要問的是「我這個工作需要多強」。這兩個問題的答案,多數時候不一樣。
先把日常丟給 Luna 跑一週。真的撞到牆再往上換,你會發現撞牆的次數比想像中少很多。
延伸閱讀
- 2026 AI 編程工具 8 強實測:$10 的 Copilot 在 SWE-Bench 贏了 $20 的 Cursor
- ChatGPT vs Claude vs Gemini 2026 怎麼選?非工程師實測
- pxpipe 是什麼?把 Claude Code 的 token 帳單砍 70% 的開源神器
- ChatGPT Work 是什麼?一句話產出 Excel、簡報、網站
免責聲明:本文為 AI 工具的使用經驗整理,所有價格、benchmark 分數與實測數據以 2026 年 8 月 4 日查得為準,AI 模型的定價與能力更新頻繁,實際情況請以官方公告為主。文中「我的實測」為單次、單一任務的手感測試(n=1),不是統計意義上的 benchmark,僅供判斷方向參考。CodeRabbit 為 AI code review 服務商,其測試結果請自行考量商業立場。





發表迴響