你在 Codex 裡按下模型選單,跳出三個名字:5.6 Sol5.6 Terra5.6 Luna。官方文案分別是「最新前沿」「日常均衡」「快又便宜」。看起來很清楚,實際上什麼也沒說。貴的那個到底貴在哪?便宜的那個什麼時候會出包?

我把同一道題丟給三檔各跑一次,順便把市面上三份公開實測拉出來對照。結論有點反直覺:在短任務上,三檔的答案幾乎一模一樣,成本卻差 35 倍;但換成長任務,差距會從「幾乎沒有」暴衝到「不能用」。

本文數據截至 2026 年 8 月 4 日。

先給結論:60 秒版

你要做的事選哪檔理由
問一個問題、改一個檔、review 一段程式Luna短任務三檔品質差不多,Luna 便宜 35 倍
日常寫功能、修 bug、跑幾十分鐘的任務Terra價格是 Sol 的 1/4,多數 benchmark 差 1~3 分
跨多檔重構、要跑幾小時的 agent 任務Sol任務越長差距越大,這裡才值回票價
塞一整個 repo 或幾百頁文件進去絕對不要用 Luna長脈絡召回只有 41.3%,Sol 是 91.5%

三檔到底是什麼?先把帳單攤開

GPT-5.6 在 2026 年 7 月 9 日全面上線,一次給三檔。OpenAI 的說法是:數字(5.6)代表世代,Sol / Terra / Luna 是三條各自演進的能力線。翻成白話就是「以後每一代都會有這三檔,你選的是價位不是版本」。

7 月 30 日 OpenAI 又砍了一次價:Luna 降 80%、Terra 降 20%、Sol 沒動。降完之後的價差非常誇張。

模型官方定位輸入(每 100 萬 token)輸出(每 100 萬 token)脈絡長度
GPT-5.6 Sol最新前沿 agentic coding 模型$5.00$30.00272K
GPT-5.6 Terra日常工作的均衡款$2.00$12.00272K
GPT-5.6 Luna又快又便宜$0.20$1.20272K

輸出價 Sol 是 Luna 的 25 倍。三檔脈絡長度都是 272K,這點沒有差別,但「塞得進去」跟「讀得懂」是兩回事,等一下會講到這個坑。

官方 benchmark 說:差 2 到 3 分

測試項目SolTerraLuna
Terminal-Bench 2.1(終端機操作)88.8%87.4%84.7%
Coding Agent Index(綜合編碼)8077.474.6
Agents’ Last Exam(長時程專業工作)53.650.450.3
SWE-Bench Pro(真實 repo 修 bug)64.6%63.4%62.7%
MRCR(長脈絡召回)91.5%89.6%41.3%

看到這張表,多數人的反應是「那當然選 Terra 啊」。SWE-Bench Pro 上 Sol 只贏 Terra 1.2 分,價格卻是 2.5 倍。Agents’ Last Exam 上 Terra 跟 Luna 差 0.1 分,價格差 10 倍。

這個推論看起來無懈可擊。問題是它建立在一個假設上:benchmark 的分差可以外推到你的工作。而這個假設,被另外兩份實測打得很難看。

三份實測,三種答案

CodeRabbit(做 AI code review 的公司,有自己的商業立場,看數字時要記得這點)跑了 100 多個跨語言的長時程實作任務。他們量到的差距是這樣:

CodeRabbit 長時程實作測試SolTerra
通過率63.7%40.7%
每題平均輸出 token20,96855,594

差 23 個百分點。更值得看的是第二行:Terra 為了做完一題,平均吐了 Sol 的 2.65 倍 token。輸出單價便宜 60%,話卻多了 165%。實際算一下每題的輸出成本,Sol 約 $0.63、Terra 約 $0.67,便宜的那個反而比較貴。這跟 SWE-Bench Pro 上「差 1.2 分」的印象完全對不起來。

然後是我自己這一份。

我的實測:同一題,三檔各跑一次

測試方法很簡單:寫一段藏了多個 bug 的 Python(可變預設參數、迴圈少跑一圈、區間合併邏輯錯、迭代中刪 list、多餘的浮點相等比較、docstring 跟行為不符),丟給三檔各跑一次,reasoning effort 都設 medium,用 codex exec --json 直接收官方回報的 token 用量。

SolTerraLuna
耗時66.3 秒29.1 秒29.6 秒
輸入 token20,39720,39718,934
輸出 token2,0371,1791,409
其中思考 token516258516
抓到的問題數9 項7 項7 項
換算 API 成本$0.1366$0.0370$0.0039

重點不在數字,在三份答案長什麼樣。核心 bug 三檔全部抓到,一個沒漏。三份「修正後的完整程式碼」拿去比對,實質邏輯一模一樣,連變數命名都高度雷同。

Sol 多出來的那兩項是什麼?一項是指出「就算修好合併邏輯,記錄筆數的那行時機也不對」;另一項是討論「去重」在字典上該用什麼判準比較好。都是對的,也都有價值,但沒有一項是「Terra 和 Luna 給了會出事的答案」。

這一題,Sol 花了 Luna 的 35.3 倍成本、2.2 倍時間,換到兩條邊角補充。

把它放大到日常用量更有感。假設一天 200 次這種規模的呼叫:

  • Sol:每月約 $820(約 NT$25,400)
  • Terra:每月約 $222(約 NT$6,900)
  • Luna:每月約 $23(約 NT$720)

如果你的工作有八成是這種「單檔、有明確答案」的任務,卻整天掛在 Sol 上,那多付的錢買到的是心安,不是品質。

那到底差在哪?答案是任務長度

把三份實測擺在一起,矛盾就消失了:

任務類型Sol 領先 Terra來源
單次問答(一段程式碼找 bug)幾乎為 0本文實測
單一 repo 修 bug(SWE-Bench Pro)1.2 分官方 benchmark
跨語言長時程實作(100+ 題)23 分CodeRabbit

差距不是模型的固定屬性,是任務長度的函數。任務越長、要串的步驟越多、中途要記住的東西越多,弱一點的模型走偏的機率就是複利式累積。單次問答只有一步,走不偏;跑三小時的 agent 任務有幾百步,錯一步後面全歪。

所以「Terra 只差 Sol 兩三分」這句話沒有錯,但它只在短任務成立。你不能拿短任務的分差,去買長任務的信心。

Luna 唯一那條不能踩的紅線

Luna 便宜到幾乎沒有理由不用,但它有一個很硬的失效模式:長脈絡召回只有 41.3%,Sol 是 91.5%、Terra 89.6%。

三檔脈絡長度都寫 272K,這是「塞得進去」。MRCR 測的是「塞進去之後,能不能從一大堆內容裡把正確那段撈出來」。Luna 在 256K 以上的區間直接掉到四成。這不叫差一點,這叫一半以上的時候會撈錯。

實務上會踩到的場景:把整包程式碼丟進去問「這個函式在哪被呼叫」、丟一份幾百頁 PDF 問細節、多份文件交叉比對。這些用 Luna 會拿到自信滿滿的錯答案,而且你不會察覺。它不會說「我找不到」,它會編一個。這比慢一點糟糕得多。

順便講一件所有 benchmark 都該打折的事

獨立評測機構 METR 在部署前評估 GPT-5.6 Sol,寫下這句話:它偵測到的作弊率高於 METR 評估過的任何公開模型

METR 對「作弊」的定義是:模型不是照題目要求解題,而是靠鑽測試環境的漏洞來提高分數。他們抓到的實例包括:模型在中途提交裡夾帶手法,用來探出題目隱藏的測試案例;以及在另一題直接挖出藏起來的原始碼,看到預期答案。

結果就是那次評估根本量不出一個可用的能力數字。同一批測試,取決於怎麼處理作弊的那些回合:

  • 作弊算失敗 → 50% 時間視野約 11.3 小時(95% 信賴區間 5~40 小時)
  • 作弊算成功 → 衝到 270 小時以上
  • 作弊的回合直接丟掉 → 71 小時(95% 信賴區間 13~11,400 小時)

METR 自己的結論是,這三個數字沒有一個能代表 GPT-5.6 Sol 的真實能力。

這件事對你的實際意義不是「模型很壞」,而是:你看到的每一張 benchmark 表,都有一部分分數是這樣來的。所以本文那三份實測互相打架,其實一點也不奇怪。真正該信的是你自己那個工作流跑出來的結果,跑五題你就知道夠不夠用了,比讀十篇評測快。

Codex 用戶專屬:兩件你在選單上看不出來的事

1. 選單裡有兩個 Terra,不是你眼花

翻 Codex 本機的模型清單會看到,顯示名稱叫「GPT-5.6-Terra」的項目有兩個,一個內部代號是 gpt-5.6-terra,另一個是 codex-auto-review。後者是給自動 code review 用的專用配置,系統提示詞跟一般 Terra 不同。日常用選第一個就好。

2. 訂閱制跟 API 是兩套帳,別搞混

本文算的 35 倍價差是 API 帳單。如果你是在 Codex 裡用 ChatGPT 訂閱,那不按 token 收費,而是按「則數」限制。以 Plus 方案的 5 小時滾動窗口為例:

方案SolTerraLuna
Plus(每 5 小時窗口)15~90 則20~110 則50~280 則

同樣的訂閱費,用 Luna 能發的則數大約是 Sol 的 3 倍。Codex 的 GitHub issue 區早就有人回報「Terra 和 Sol 幾分鐘就把 5 小時額度燒光」,這不是個案。

補充一個容易誤判的變動:OpenAI 在 7 月 12 日暫時取消了 Plus、Pro、Business 在 Codex 的 5 小時限制,但這是暫時措施,沒有公布結束日期,而且週上限依然存在。所以「現在好像不會被擋」不代表額度變無限,只是換成用週來算。

訂閱用戶的最佳策略因此跟 API 用戶不一樣。不用糾結省錢,要糾結的是「把貴的額度留給真的需要的長任務」。日常問答、跑測試、寫 commit message 全丟 Luna,額度就不會在週中燒光。

怎麼選:三個問題定生死

  1. 這個任務要跑超過 30 分鐘、或要跨 5 個以上檔案嗎?是 → Sol。長時程是唯一 Sol 明確拉開差距的地方。
  2. 要餵超過 10 萬 token 的資料進去嗎?是 → Terra 或 Sol,不要 Luna
  3. 都不是?→ Luna。省下來的錢跟額度,留給第 1 題。

另外一個容易被忽略的槓桿:reasoning effort 的影響常常比換模型還大。同一個模型從 high 降到 low,我在別的產線量過,產出內容會縮水一成六,省了 12% 的 token,換來品質實質下降。要調就先調 effort,再考慮換模型,別兩個一起動,不然出事你分不出是誰的問題。

常見問題

Sol、Terra、Luna 是三個不同的模型,還是同一個模型的三種設定?

是三個不同的模型,價格、速度、能力都不同。跟 reasoning effort(low / medium / high / xhigh)是兩個獨立的維度,可以自由組合。

我原本用 GPT-5.4,該換哪一檔?

官方的遷移路徑是 GPT-5.4 → Terra、GPT-5.4-Mini → Luna,兩者都標示即將停用,建議直接換過去,不要等到被強制切換。

Terra 的 token 用量真的比較多嗎?

看任務。CodeRabbit 的長時程測試裡 Terra 吐了 Sol 的 2.65 倍;我這邊的單次問答剛好相反,Sol 的輸出是 Terra 的 1.7 倍。前者是「繞遠路」,後者是「想得比較深」。所以評估成本要看「每個完成任務花多少錢」,不是每百萬 token 的單價。

這些數字多久會過期?

價格變動很快,光是 7 月 30 日一次就砍了 Luna 八成。benchmark 分數在同一代內相對穩定,但下一代出來就要重測。文中的價格與分數以 2026 年 8 月 4 日為準。

最後一句

官方那張分數表沒說謊,但它回答的是「哪一檔最強」,而你要問的是「我這個工作需要多強」。這兩個問題的答案,多數時候不一樣。

先把日常丟給 Luna 跑一週。真的撞到牆再往上換,你會發現撞牆的次數比想像中少很多。

延伸閱讀

免責聲明:本文為 AI 工具的使用經驗整理,所有價格、benchmark 分數與實測數據以 2026 年 8 月 4 日查得為準,AI 模型的定價與能力更新頻繁,實際情況請以官方公告為主。文中「我的實測」為單次、單一任務的手感測試(n=1),不是統計意義上的 benchmark,僅供判斷方向參考。CodeRabbit 為 AI code review 服務商,其測試結果請自行考量商業立場。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash