OpenAI 說快 14 倍。Cerebras 的官方部落格裡,另一個數字寫著 5.6 倍。兩邊講的是同一個東西。
一句話結論:GPT-5.6 Sol Ultrafast 是 OpenAI 2026 年 8 月 13 日推出的 API 高速層,由 Cerebras 驅動、最高每秒 750 個 token;14 倍是峰值吐字速度,你實際會感受到的是 GDP-Val 上那個 5.6 倍。
2026 年 8 月 13 日,OpenAI 發布 Ultrafast 模式,標題掛的數字是「up to 14X the speed」。同一天,Cerebras 也發了一篇。兩篇講同一次發布,但數字對不上。不是誰造假,是兩邊在量不同的東西。
這篇把四個倍數拆開,告訴你哪個是宣傳、哪個是你付錢之後真的會拿到的。(本文資訊截至 2026 年 8 月 14 日)
Ultrafast 是什麼?跟原本的 GPT-5.6 Sol 差在哪?
差在硬體,不差在模型。Ultrafast 是 OpenAI API 新增的一個服務層(service tier),跑的還是同一隻 GPT-5.6 Sol,參數沒縮、沒蒸餾、沒換小模型,只是換到 Cerebras 的晶片上跑。
這點值得停一下。過去要「快」,業界的作法是換一隻笨一點的模型。你想即時回應,就得接受答案差一截。OpenAI 官方部落格自己這樣描述這個舊取捨:
「在此之前,要拿到即時速度,通常意味著要改用比較小或比較專門的模型。Ultrafast 指向另一個方向:每秒做更多有用的工作。」
OpenAI,2026 年 8 月 13 日
| 項目 | 內容 |
|---|---|
| 發布日 | 2026 年 8 月 13 日 |
| 模型 | GPT-5.6 Sol(與 Standard 同一隻,非精簡版) |
| 最高輸出速度 | 每秒 750 個 output token |
| 硬體 | Cerebras Wafer-Scale Engine |
| 供應範圍 | 先在 OpenAI API,限量預覽、僅開放部分客戶 |
| 品質變化 | 官方與 Cerebras 皆稱無品質下降 |
14 倍、11 倍、7 倍、5.6 倍——哪一個才是你會感受到的?
5.6 倍。其他三個都在量別的東西。
把兩邊的官方文件攤開對照,同一次發布其實給了四個不同的倍數,而它們的量測對象、比較基準、資料來源全都不一樣:
| 倍數 | 在量什麼 | 跟誰比 | 誰報的 |
|---|---|---|---|
| 14× | 峰值吐字速度(tokens/秒) | 同一隻 Sol 的 Standard 模式 | OpenAI 標題數字 |
| 11× | 輸出速度 | Claude Fable 5 | 引用第三方 Artificial Analysis 的數據 |
| 7× | 跑完整套考卷的實際耗時 | Claude Fable 5 | Cerebras 內部實測(HLE) |
| 5.6× | 真實知識工作的端到端耗時 | 同一隻 Sol 的 Standard 模式 | Cerebras 內部實測(GDP-Val) |
14 倍和 5.6 倍其實是同一組對照,都是 Ultrafast 對上 Standard。差別在於:14 倍量的是模型吐字那一瞬間有多快,5.6 倍量的是一整件事從頭做到尾快了多少。
中間那 8 倍多去哪了?去了所有不是「吐字」的環節:模型思考、呼叫工具、等外部系統回應、串接下一步。吐字快 14 倍,但如果一半時間花在等別的東西,整件事就快不到 14 倍。
這裡有個容易被忽略的細節:OpenAI 自己那篇公告,從頭到尾沒提 5.6 倍,也沒提 HLE。 5.6 倍和 7 倍全都只出現在 Cerebras 那篇。宣傳數字放在模型商的頁面,保守數字放在硬體商的頁面。這不是巧合,是兩家公司要對不同讀者交代不同的事。
5.6 倍那個 GDP-Val 是什麼?為什麼它比較準?
GDP-Val 是一套用「有經濟價值的知識工作」當題目的基準測試,題目是法律文件、財務模型、工程報告這類真的有人付錢請人做的事。
Cerebras 在這套測試上報的是 5.6 倍端到端加速,且無品質降級。關鍵字是「端到端」:不是量模型吐字多快,是量「這份財務模型從發問到交件」總共省了多少時間。這才是你按下 enter 之後,坐在螢幕前實際等待的那段時間。
另一個實測是 Humanity’s Last Exam,一套 2,500 題、通常要博士才答得出的考卷。Cerebras 讓兩邊各跑一次全套:
| 模型 | 跑完 2,500 題耗時 |
|---|---|
| GPT-5.6 Sol Ultrafast | 11 小時 11 分 |
| Claude Fable 5 | 78 小時 27 分(超過三天) |
78 小時 27 分除以 11 小時 11 分,大約 7 倍,Cerebras 自己在文中也寫「nearly 7× faster」,準確度相當。注意這個 7 倍,跟前面那個「比 Fable 5 快 11 倍」是同一組對手、不同的量法:11 倍是吐字速度,7 倍是把整套考卷做完。同一組對照,換個量法就掉了 4 倍。
小字裡藏了什麼?三個沒人會寫的但書
三個。都在 Cerebras 那篇的圖片說明和頁尾,不是藏起來,是沒人會讀。
- 兩邊不是同一天跑的,也不是同一個外殼。 HLE 那組:Ultrafast 用 Codex、xhigh 推理檔位,7 月 10 日跑;Claude Fable 5 用 Claude Code、xhigh 推理檔位,7 月 13 至 15 日跑。不同日期、不同 agent 外殼,中間隔了三到五天。
- HLE 和 GDP-Val 用的推理檔位不一樣。 HLE 那組是 xhigh,GDP-Val 那組是 medium,日期也是另一天(7 月 31 日)。兩個數字不能直接接在一起講。
- Cerebras 自己在頁尾寫了免責。 原文大意是:效能比較基於第三方測試或內部測試,相對於 GPU 系統觀察到的加速幅度,會因工作負載、配置、日期和受測模型而異。
這些但書不代表數字造假,實測本來就要挑條件。但它們解釋了為什麼你不該把 14 倍當成保證:當一次發布同時給你四個倍數,挑哪個來信,本身就決定了你的預期會不會落空。
為什麼做到這件事的是 Cerebras,不是 Nvidia?
因為這是一個搬運問題,不是算力問題。
大模型推理在 GPU 上的瓶頸不在「算得夠不夠快」,而在記憶體頻寬:模型權重放不進晶片內部,每吐一個 token 都要把權重從晶片外的記憶體搬進來一次。吐 750 個 token,就搬 750 次。晶片再快,也在等搬運。
Cerebras 的作法很直接:在一整片晶圓大小的晶片上塞 44 GB SRAM,讓權重直接住在晶片裡不用搬。 token 在跨晶圓串接起來的模型層之間連續流動,中間不落地。Cerebras 稱這個作法能隨模型變大而平順擴展。
對一般讀者,這件事的意義不在技術細節,而在產業訊號:整個行業講了兩年「買不到卡」,而 OpenAI 這次示範的不是買更多 GPU,是在特定工作上換掉 GPU。 這不代表 Nvidia 有麻煩:訓練仍然是 GPU 的天下,Ultrafast 也還在限量預覽。但推理這一塊,出現了一條結構不同的路。
快 5.6 倍,對實際工作有什麼差別?
差別不在省下的分鐘數,在於跨過了一個門檻:快到你來不及分心。
OpenAI 一位研究員 Jeffrey Wang 的說法,比任何倍數都具體:
「以前我可能要等一個任務跑幾分鐘,現在它在我還來不及切換去做別的事之前就跑完了。這讓我生產力高很多。」
Jeffrey Wang,OpenAI 研究員
這就是重點。等 3 分鐘和等 30 秒,差的不是 2 分半,是「我會不會跑去看別的東西然後忘了回來」。人的注意力有個斷點,跨過去就要重新載入整個脈絡。速度真正買到的是這個。
OpenAI 列了五個場景,共同點都是「慢了就沒用」:
- 事故處理:系統掛掉的當下讀日誌、比對近期程式碼改動,在停機還在持續時就把修復準備好
- 金融研究與安全:在行情還在變的時候分析訊號、判斷可疑交易
- 客服與語音:客人還在講話時就完成多步驟查詢,不用叫對方等一下
- 電商:在購物者還在猶豫時回答商品問題、查庫存,趕在放棄結帳之前
- 即時研究:原本要跑整晚的實驗,變成當場調完參數再跑一次
最後一項是最被低估的。OpenAI 內部團隊原本的節奏是「晚上排一批實驗,隔天早上看結果」,一天只能迭代一次;Ultrafast 之後變成一個工作天內跑好幾輪。研究速度的瓶頸從來不是想不到點子,是驗證一個想法要等多久。
另一個角度來自早期客戶 Basis 的共同創辦人 Mitch Troyanovsky:真正快的產品,門檻往往不只是每秒幾個 token,還包括模型夠不夠聰明——過去兩者只能挑一個。這也是為什麼「同一隻模型、只換硬體」比「換一隻小模型」更有意思。
現在能用嗎?要花多少錢?
還不能,除非你已經被選中。
Ultrafast 目前是限量預覽,只開放給一小批客戶,先在 OpenAI API 上線,官方說會隨產能增加逐步開放,並提供了通知登記表單。兩邊的公告都沒有公布 Ultrafast 層的定價。 這代表對絕大多數人(包括所有只用 ChatGPT 網頁版的人),這件事現在的實際影響是零——它是一則產業訊號,不是一個你今天能按的按鈕。
如果你要現在就決定什麼,大概只有兩件事值得做:
- 如果你的產品卡在延遲(語音客服、即時風控、互動式研究工具),去登記通知,並先想清楚你要的是吐字快還是端到端快——這兩件事的差距,這次示範得很清楚。
- 如果你只是想跟上,記住這篇的判斷方法比記住數字有用:看到「快 N 倍」,先問量的是哪一段、跟誰比、誰報的。這次是 14 對 5.6,下次會是別的數字。
常見問題
Ultrafast 是新模型嗎?
不是。它是 OpenAI API 的一個服務層,跑的是同一隻 GPT-5.6 Sol,模型本身沒有縮小或改動,差別只在跑在 Cerebras 的硬體上。
快 14 倍會不會變笨?
OpenAI 與 Cerebras 都表示沒有品質下降,GDP-Val 的 5.6 倍加速也標明「無品質降級」。要注意的是這些都是廠商自己的測試,第三方獨立複測目前還沒有。
ChatGPT 網頁版會變快嗎?
目前沒有。Ultrafast 先在 OpenAI API 上線,官方說法是先跟一批企業客戶測試,再把學到的東西回饋到產品上,沒有給消費端的時間表。
750 tokens/秒 大概是什麼概念?
大約是一般人閱讀速度的十幾倍以上,也就是說文字會生成得比你讀得還快,「等它打字」這個體感基本消失。實務上的意義不是你讀得更快,而是多步驟的工具呼叫可以在一次對話裡跑完。
結論:該記住哪個數字?
記 5.6 倍。
14 倍會被所有人抄,它在標題裡、在推文裡、在轉載稿裡。但 14 倍量的是模型吐字那一瞬間,5.6 倍量的是你真的坐在那裡等的那段時間。當一次發布同時給你四個倍數,最大的那個通常是給媒體看的,最小的那個才是給你用的。
還有一件事值得記著:這次真正的變化不在數字,在於「要快就得換笨模型」這個取捨第一次被拆開,而拆開它的是換硬體,不是換模型。如果這條路走得通,接下來會出現更多「同一隻模型、不同速度層」的定價方式——那時候要問的問題,還是這一篇的問題:你買的是吐字快,還是做完快?
延伸閱讀
- GPT-5.6 Sol、Terra、Luna 差在哪?同一題實測:答案幾乎一樣,成本差 35 倍——同一隻 Sol 的成本面對照
- 一隻 AI 答對近 100%,四隻一起剩 17%:Anthropic 多 agent 實測——速度上去之後,堆更多 agent 是不是好主意
- OpenAI Astra 踩到 Critical 紅線:對照官方原文的 4 個誤讀——另一次「官方原文和轉述差很多」的拆解
資料來源
- OpenAI — Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed(2026-08-13)
- Cerebras — Accelerating GPT-5.6 Sol Ultrafast(2026-08-13)
免責聲明:本文為技術與產業資訊整理,非投資建議。文中所有效能數字均引用自 OpenAI 與 Cerebras 官方公告,屬廠商自行測試或引用第三方測試結果,測試條件(日期、推理檔位、agent 外殼)在原文中並不一致,實際表現會因工作負載與配置而異,截稿時尚無獨立第三方複測。資訊截至 2026 年 8 月 14 日,AI 產品變動極快,請以官方最新公告為準。







發表迴響