OpenAI 說快 14 倍。Cerebras 的官方部落格裡,另一個數字寫著 5.6 倍。兩邊講的是同一個東西。

一句話結論:GPT-5.6 Sol Ultrafast 是 OpenAI 2026 年 8 月 13 日推出的 API 高速層,由 Cerebras 驅動、最高每秒 750 個 token;14 倍是峰值吐字速度,你實際會感受到的是 GDP-Val 上那個 5.6 倍。

2026 年 8 月 13 日,OpenAI 發布 Ultrafast 模式,標題掛的數字是「up to 14X the speed」。同一天,Cerebras 也發了一篇。兩篇講同一次發布,但數字對不上。不是誰造假,是兩邊在量不同的東西。

這篇把四個倍數拆開,告訴你哪個是宣傳、哪個是你付錢之後真的會拿到的。(本文資訊截至 2026 年 8 月 14 日)

Ultrafast 是什麼?跟原本的 GPT-5.6 Sol 差在哪?

差在硬體,不差在模型。Ultrafast 是 OpenAI API 新增的一個服務層(service tier),跑的還是同一隻 GPT-5.6 Sol,參數沒縮、沒蒸餾、沒換小模型,只是換到 Cerebras 的晶片上跑。

這點值得停一下。過去要「快」,業界的作法是換一隻笨一點的模型。你想即時回應,就得接受答案差一截。OpenAI 官方部落格自己這樣描述這個舊取捨:

「在此之前,要拿到即時速度,通常意味著要改用比較小或比較專門的模型。Ultrafast 指向另一個方向:每秒做更多有用的工作。」

OpenAI,2026 年 8 月 13 日
項目內容
發布日2026 年 8 月 13 日
模型GPT-5.6 Sol(與 Standard 同一隻,非精簡版)
最高輸出速度每秒 750 個 output token
硬體Cerebras Wafer-Scale Engine
供應範圍先在 OpenAI API,限量預覽、僅開放部分客戶
品質變化官方與 Cerebras 皆稱無品質下降

14 倍、11 倍、7 倍、5.6 倍——哪一個才是你會感受到的?

5.6 倍。其他三個都在量別的東西。

把兩邊的官方文件攤開對照,同一次發布其實給了四個不同的倍數,而它們的量測對象、比較基準、資料來源全都不一樣:

倍數在量什麼跟誰比誰報的
14×峰值吐字速度(tokens/秒)同一隻 Sol 的 Standard 模式OpenAI 標題數字
11×輸出速度Claude Fable 5引用第三方 Artificial Analysis 的數據
跑完整套考卷的實際耗時Claude Fable 5Cerebras 內部實測(HLE)
5.6×真實知識工作的端到端耗時同一隻 Sol 的 Standard 模式Cerebras 內部實測(GDP-Val)

14 倍和 5.6 倍其實是同一組對照,都是 Ultrafast 對上 Standard。差別在於:14 倍量的是模型吐字那一瞬間有多快,5.6 倍量的是一整件事從頭做到尾快了多少。

中間那 8 倍多去哪了?去了所有不是「吐字」的環節:模型思考、呼叫工具、等外部系統回應、串接下一步。吐字快 14 倍,但如果一半時間花在等別的東西,整件事就快不到 14 倍。

這裡有個容易被忽略的細節:OpenAI 自己那篇公告,從頭到尾沒提 5.6 倍,也沒提 HLE。 5.6 倍和 7 倍全都只出現在 Cerebras 那篇。宣傳數字放在模型商的頁面,保守數字放在硬體商的頁面。這不是巧合,是兩家公司要對不同讀者交代不同的事。

5.6 倍那個 GDP-Val 是什麼?為什麼它比較準?

GDP-Val 是一套用「有經濟價值的知識工作」當題目的基準測試,題目是法律文件、財務模型、工程報告這類真的有人付錢請人做的事。

Cerebras 在這套測試上報的是 5.6 倍端到端加速,且無品質降級。關鍵字是「端到端」:不是量模型吐字多快,是量「這份財務模型從發問到交件」總共省了多少時間。這才是你按下 enter 之後,坐在螢幕前實際等待的那段時間。

另一個實測是 Humanity’s Last Exam,一套 2,500 題、通常要博士才答得出的考卷。Cerebras 讓兩邊各跑一次全套:

模型跑完 2,500 題耗時
GPT-5.6 Sol Ultrafast11 小時 11 分
Claude Fable 578 小時 27 分(超過三天)

78 小時 27 分除以 11 小時 11 分,大約 7 倍,Cerebras 自己在文中也寫「nearly 7× faster」,準確度相當。注意這個 7 倍,跟前面那個「比 Fable 5 快 11 倍」是同一組對手、不同的量法:11 倍是吐字速度,7 倍是把整套考卷做完。同一組對照,換個量法就掉了 4 倍。

小字裡藏了什麼?三個沒人會寫的但書

三個。都在 Cerebras 那篇的圖片說明和頁尾,不是藏起來,是沒人會讀。

  • 兩邊不是同一天跑的,也不是同一個外殼。 HLE 那組:Ultrafast 用 Codex、xhigh 推理檔位,7 月 10 日跑;Claude Fable 5 用 Claude Code、xhigh 推理檔位,7 月 13 至 15 日跑。不同日期、不同 agent 外殼,中間隔了三到五天。
  • HLE 和 GDP-Val 用的推理檔位不一樣。 HLE 那組是 xhigh,GDP-Val 那組是 medium,日期也是另一天(7 月 31 日)。兩個數字不能直接接在一起講。
  • Cerebras 自己在頁尾寫了免責。 原文大意是:效能比較基於第三方測試或內部測試,相對於 GPU 系統觀察到的加速幅度,會因工作負載、配置、日期和受測模型而異。

這些但書不代表數字造假,實測本來就要挑條件。但它們解釋了為什麼你不該把 14 倍當成保證:當一次發布同時給你四個倍數,挑哪個來信,本身就決定了你的預期會不會落空。

為什麼做到這件事的是 Cerebras,不是 Nvidia?

因為這是一個搬運問題,不是算力問題。

大模型推理在 GPU 上的瓶頸不在「算得夠不夠快」,而在記憶體頻寬:模型權重放不進晶片內部,每吐一個 token 都要把權重從晶片外的記憶體搬進來一次。吐 750 個 token,就搬 750 次。晶片再快,也在等搬運。

Cerebras 的作法很直接:在一整片晶圓大小的晶片上塞 44 GB SRAM,讓權重直接住在晶片裡不用搬。 token 在跨晶圓串接起來的模型層之間連續流動,中間不落地。Cerebras 稱這個作法能隨模型變大而平順擴展。

對一般讀者,這件事的意義不在技術細節,而在產業訊號:整個行業講了兩年「買不到卡」,而 OpenAI 這次示範的不是買更多 GPU,是在特定工作上換掉 GPU。 這不代表 Nvidia 有麻煩:訓練仍然是 GPU 的天下,Ultrafast 也還在限量預覽。但推理這一塊,出現了一條結構不同的路。

快 5.6 倍,對實際工作有什麼差別?

差別不在省下的分鐘數,在於跨過了一個門檻:快到你來不及分心。

OpenAI 一位研究員 Jeffrey Wang 的說法,比任何倍數都具體:

「以前我可能要等一個任務跑幾分鐘,現在它在我還來不及切換去做別的事之前就跑完了。這讓我生產力高很多。」

Jeffrey Wang,OpenAI 研究員

這就是重點。等 3 分鐘和等 30 秒,差的不是 2 分半,是「我會不會跑去看別的東西然後忘了回來」。人的注意力有個斷點,跨過去就要重新載入整個脈絡。速度真正買到的是這個。

OpenAI 列了五個場景,共同點都是「慢了就沒用」:

  • 事故處理:系統掛掉的當下讀日誌、比對近期程式碼改動,在停機還在持續時就把修復準備好
  • 金融研究與安全:在行情還在變的時候分析訊號、判斷可疑交易
  • 客服與語音:客人還在講話時就完成多步驟查詢,不用叫對方等一下
  • 電商:在購物者還在猶豫時回答商品問題、查庫存,趕在放棄結帳之前
  • 即時研究:原本要跑整晚的實驗,變成當場調完參數再跑一次

最後一項是最被低估的。OpenAI 內部團隊原本的節奏是「晚上排一批實驗,隔天早上看結果」,一天只能迭代一次;Ultrafast 之後變成一個工作天內跑好幾輪。研究速度的瓶頸從來不是想不到點子,是驗證一個想法要等多久。

另一個角度來自早期客戶 Basis 的共同創辦人 Mitch Troyanovsky:真正快的產品,門檻往往不只是每秒幾個 token,還包括模型夠不夠聰明——過去兩者只能挑一個。這也是為什麼「同一隻模型、只換硬體」比「換一隻小模型」更有意思。

現在能用嗎?要花多少錢?

還不能,除非你已經被選中。

Ultrafast 目前是限量預覽,只開放給一小批客戶,先在 OpenAI API 上線,官方說會隨產能增加逐步開放,並提供了通知登記表單。兩邊的公告都沒有公布 Ultrafast 層的定價。 這代表對絕大多數人(包括所有只用 ChatGPT 網頁版的人),這件事現在的實際影響是零——它是一則產業訊號,不是一個你今天能按的按鈕。

如果你要現在就決定什麼,大概只有兩件事值得做:

  1. 如果你的產品卡在延遲(語音客服、即時風控、互動式研究工具),去登記通知,並先想清楚你要的是吐字快還是端到端快——這兩件事的差距,這次示範得很清楚。
  2. 如果你只是想跟上,記住這篇的判斷方法比記住數字有用:看到「快 N 倍」,先問量的是哪一段、跟誰比、誰報的。這次是 14 對 5.6,下次會是別的數字。

常見問題

Ultrafast 是新模型嗎?

不是。它是 OpenAI API 的一個服務層,跑的是同一隻 GPT-5.6 Sol,模型本身沒有縮小或改動,差別只在跑在 Cerebras 的硬體上。

快 14 倍會不會變笨?

OpenAI 與 Cerebras 都表示沒有品質下降,GDP-Val 的 5.6 倍加速也標明「無品質降級」。要注意的是這些都是廠商自己的測試,第三方獨立複測目前還沒有。

ChatGPT 網頁版會變快嗎?

目前沒有。Ultrafast 先在 OpenAI API 上線,官方說法是先跟一批企業客戶測試,再把學到的東西回饋到產品上,沒有給消費端的時間表。

750 tokens/秒 大概是什麼概念?

大約是一般人閱讀速度的十幾倍以上,也就是說文字會生成得比你讀得還快,「等它打字」這個體感基本消失。實務上的意義不是你讀得更快,而是多步驟的工具呼叫可以在一次對話裡跑完。

結論:該記住哪個數字?

記 5.6 倍。

14 倍會被所有人抄,它在標題裡、在推文裡、在轉載稿裡。但 14 倍量的是模型吐字那一瞬間,5.6 倍量的是你真的坐在那裡等的那段時間。當一次發布同時給你四個倍數,最大的那個通常是給媒體看的,最小的那個才是給你用的。

還有一件事值得記著:這次真正的變化不在數字,在於「要快就得換笨模型」這個取捨第一次被拆開,而拆開它的是換硬體,不是換模型。如果這條路走得通,接下來會出現更多「同一隻模型、不同速度層」的定價方式——那時候要問的問題,還是這一篇的問題:你買的是吐字快,還是做完快?

延伸閱讀

資料來源

免責聲明:本文為技術與產業資訊整理,非投資建議。文中所有效能數字均引用自 OpenAI 與 Cerebras 官方公告,屬廠商自行測試或引用第三方測試結果,測試條件(日期、推理檔位、agent 外殼)在原文中並不一致,實際表現會因工作負載與配置而異,截稿時尚無獨立第三方複測。資訊截至 2026 年 8 月 14 日,AI 產品變動極快,請以官方最新公告為準。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash