最後更新:2026 年 9 月 6 日。本文數字取自 OpenAI 與 Anthropic 官方發布頁,原文連結列在文末。價格與版本以官網為準。
九月第一週,兩家最前沿的實驗室各發了一次「史上最強」。沒有一個開源。
一句話結論:GPT-6 Astra 沒有開源,Claude Fable 5.1 也沒有。2026 年 9 月這一週真正的變化是分層准入——同一個模型會依你的身分套上不同安全閘,Anthropic 官方頁把同一個模型的兩個版本列成 55.8% 和 60.9%,差 5.1 分。
OpenAI 在 9 月 3 日發布 GPT-6 Astra,Anthropic 在 9 月 1 日發布 Claude Fable 5.1 與 Mythos 5.1。三個都是閉源專有,API 標價完全一樣:每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。而分數表上最值得看的一行,是同一個模型的兩個版本自己跟自己差了 5.1 分。
GPT-6 Astra 開源了嗎?
沒有。Astra 是閉源專有模型,只透過 ChatGPT 訂閱、OpenAI API、Microsoft Azure 和 AWS Bedrock 提供,沒有釋出權重。Anthropic 這邊也一樣,Fable 5.1 和 Mythos 5.1 都只在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 上調用。
這本身不算新聞。值得拆的是兩家同一週不約而同做的另一件事:把同一個模型切成不同的准入層。
Mythos 5.1 和 Fable 5.1 差在哪?
官方說法是:沒有差別。Anthropic 發布頁的原話是兩者「are the same model, but with different levels of safeguards」——同一個模型,不同程度的安全閘。Fable 5.1 一般可用,Mythos 5.1 只給通過審核的組織。
同一頁的分數表上,兩者在 Terminal-Bench 4.0 分別是 55.8% 和 60.9%。Anthropic 在圖說裡解釋這 5.1 分的來源:「the gap between them reflects the tasks on which our earlier, less precise cyber safeguards intervened」——差距來自安全閘攔下來的那些題目。
被攔下來的題目算零分。這不是修辭:註腳寫明 Fable 5.1 是在生產安全閘開啟下測的,安全閘介入的題目,Fable 5.1 和 Fable 5 在 OSWorld 2.0 上直接得零。
為什麼一個安全閘可以值 5.1 分?
因為被攔的不是邊角料,是這一代模型最會做的事。
Anthropic 這次放寬了一部分:Fable 5.1 現在可以用來找出軟體漏洞,Claude Code 使用者每次工作階段被打斷的次數比 Fable 5 少約 60%。但滲透測試、漏洞利用程式產生、二進位漏洞掃描這三類雙用途任務,仍會被導去 Opus 模型。
OpenAI 那邊用字幾乎重疊。Astra 是第一個在自家 Preparedness Framework 下達到網絡安全「Critical」門檻的 OpenAI 模型,官方頁寫明上線版本可以做安全程式碼審查和修補,但「will refuse to comply with more advanced cybersecurity tasks such as creating proof-of-concept exploits」——會拒絕產生概念驗證漏洞利用程式;之後會透過 OpenAI Daybreak 擴大存取、放寬安全閘。
兩家對「可以找漏洞、不可以寫利用程式」這條線的畫法一致到有點驚人。而它不是產品邊界,是准入邊界。
那到底誰最強?看你把安全閘開到哪一格
把兩家官方頁的 Terminal-Bench 4.0 數字排在一起,位置關係就出來了。
| Terminal-Bench 4.0 | OpenAI 官方頁 | Anthropic 官方頁 |
|---|---|---|
| GPT-6 Astra | 57.9% | 未列 |
| Claude Mythos 5.1(安全閘較寬) | 未列 | 60.9% |
| Claude Fable 5.1(一般可用) | 55.8% | 55.8% |
| Claude Opus 5 | 52.6% | 52.3% |
| Claude Fable 5 | 44.5% | 42.0% |
| GPT-5.6 Sol | 37.3% | 37.3% |
Astra 的 57.9% 落在 Fable 5.1 的 55.8% 和 Mythos 5.1 的 60.9% 中間,而 Fable 和 Mythos 是同一個模型。所以「Astra 在終端任務上贏 Claude」成立與否,取決於你拿哪一格來比——OpenAI 的比較表列的是 55.8% 那一格。
OpenAI 沒有隱瞞,只是放在註腳。該頁註腳 17 寫著:ScreenSpot-Pro 和 ExploitGym 這兩項,「the Fable scores we report come from Mythos, which is Fable with fewer safeguards」——引用的 Fable 分數其實來自 Mythos。OpenAI 自己也會依測項在兩個版本之間切換。
讀廠商跑分表的時候,第一個要問的不是「誰分數高」,是「這一行是哪個版本、開了哪些閘、誰跑的」。同一個模型可以合法地產出兩個分數。
兩家的准入層長什麼樣?
下面這張表把兩家官方頁寫明的分層攤開。官方頁沒寫的一律標明,不做推測。
| GPT-6 Astra | Claude Fable 5.1 | Claude Mythos 5.1 | |
|---|---|---|---|
| 發布日 | 2026-09-03 | 2026-09-01 | 2026-09-01 |
| 開源/開放權重 | 否 | 否 | 否 |
| 輸入/輸出價(每百萬 token) | $10 / $50 | $10 / $50 | $10 / $50 |
| 快取讀取 | 另計,官方頁未給費率 | $0.25 | $0.25 |
| 加速模式 | Fast mode:2 倍價格、最高 2 倍速 | 未提供 | 未提供 |
| 上下文窗口 | 官方頁未列出規格(長文測試做到 1M) | 1M token | 1M token |
| 誰拿得到 | 先給少量組織,數日內開放 Plus/Pro/Business/Enterprise 與 API;企業工作區預設關閉 | 一般可用,全平台上線 | 邀請制,通過審核才有 |
| 審核管道 | OpenAI Daybreak(放寬安全閘) | 不適用 | 網絡安全與生命科學兩個受信任存取計畫;後者與美國政府合作,目前僅限一批美國組織 |
一個小地方值得記下來。Anthropic 產品文件頁把 Mythos 5.1 描述成「Claude Fable 5.1 for Project Glasswing participants」,而同週發布頁列出的管道叫 Cyber Verification Program 和 Life Sciences Verification Program。兩份都是官方,不能用其中一份否定另一份,這裡照實並列。
你落在哪一層?
回答三題,看看你實際拿到的是哪個版本。工具只做分類,不傳送任何資料。
同一個價,換算成你的帳單是多少?
兩家標價一樣,帳單不一定一樣,差別主要在快取讀取。Anthropic 把快取讀取降到每百萬 token 0.25 美元,比 Fable 5 便宜 75%,官方估計一般工作量總成本降約 25%、高度代理式最多降約 45%。OpenAI 說快取讀寫另有費率,但發布頁沒給數字。
對只用訂閱版的人,有什麼實際影響?
三件事會直接碰到。
- 你看到的排行榜不一定是你拿到的版本。跑分表那一行可能來自安全閘較寬的版本。判斷值不值得換,先確認那一行對應的是不是你能拿到的那一格。
- 安全檢查會打斷正常工作。OpenAI 官方頁直說額外的安全檢查有時會拖慢、暫停或中止合法工作,包括防禦性資安;在 ChatGPT 或 Codex 裡要你確認後再繼續,在 API 上任務直接停止。
- 企業版預設關閉。Astra 在企業工作區推出時是關的,要管理員手動開。公司買了不等於你用得到。
該換上去嗎?
看你的工作屬於哪一類,兩家官方公布的數字已經足以分辨。
| 你的工作 | 建議 | 依據 |
|---|---|---|
| 瀏覽器/桌面自動化 | Astra 值得優先測 | OSWorld 2.0 離線子集 72.6%,對 GPT-5.6 Sol 的 65.7%;每題耗時由約 75 分鐘降到約 40 分鐘 |
| 一般推理、日常寫程式 | 不急著換 | OpenAI 自己公布的 Artificial Analysis Intelligence Index v4.1.1:Astra 61.2,Fable 5.1 65.7;Humanity’s Last Exam 帶工具:Astra 57.2%,Fable 5.1 65.0% |
| 長時間無人看管的代理式工作 | 兩邊都在主打,用自己的用量實測 | Anthropic 主打快取降價後省約 45%;OpenAI 主打 Codex 跨上下文窗口保留筆記 |
| 防禦性資安 | 可以用,但會被中斷 | 兩家都放行「找漏洞」、都攔「寫利用程式」 |
| 攻擊性資安、生命科學研發 | 先走審核 | 兩家的受信任存取計畫 |
提醒一句:上表 Astra 那幾個數字全部出自 OpenAI 自己的發布頁,多數對照模型也是 OpenAI 自己跑的。OpenAI 在註腳承認,Claude 在 OSWorld 和 BenchCAD 上的成績用的設定與 Anthropic 公布的跑法不同。在有第三方重跑之前只能當方向參考。
不想被綁在這兩家,有替代方案嗎?
有,方向相反:開放權重模型仍然在出。目前公開排名靠前的包括 Qwen3.8 Max、GLM-5.3、Kimi K3 等,授權從 MIT、Apache-2.0 到各家自訂條款都有。它們在絕對能力上追不上這一週這三個,但權重在你手上,沒有人能在你不知情的時候調整你那一層的安全閘。
如果你要本機跑、資料不能外流、或者不想被單一供應商的存取政策綁住,這條路仍然成立。拿它跟閉源前沿比絕對分數就會失望。
這一週真正的訊號是什麼?
不是誰跑分贏。是兩家獨立的實驗室在同一週各自把最強的能力切成兩層,然後用幾乎相同的措辭描述那條線。
Astra 在 ExploitBench 拿到 100%,前一代 GPT-5.6 Sol 是 78.5%;在一個用 2026 年 6 至 8 月漏洞新建的評測裡,Astra 自行發現並用上兩個此前未知的零日漏洞,OpenAI 說已通報維護者。Anthropic 那邊說 Mythos 5.1 是他們發布過網絡安全能力最強的模型,但仍落在自家框架的較低風險級。
還有一句值得單獨拿出來。OpenAI 在同一頁寫,評測發現 Astra 的書面推理比 GPT-5.6 Sol 更難監控,並說明「we take the decline seriously」。對打算靠讀模型思考過程來做治理的團隊,這句比任何跑分都重要。
過去大家用「開源 / 閉源」兩個桶裝所有模型。這週之後要多問一句:在閉源這邊,你站哪一層。
常見問題
GPT-6 Astra 什麼時候一般人用得到?
OpenAI 官方頁說 9 月 3 日先給少量組織,之後數日內開放給所有 ChatGPT Plus、Pro、Business、Enterprise 使用者以及 API、Azure、AWS Bedrock,但沒給明確的一般可用日期。企業工作區預設關閉。
Mythos 5.1 要怎麼申請?
透過 Anthropic 的兩個受信任存取計畫:網絡安全與生命科學。後者與美國政府合作,目前只開放給一批美國組織。申請入口以官網為準。
兩家標價都是 $10 / $50,是不是成本一樣?
標價一樣,帳單不一定。Anthropic 公布快取讀取每百萬 token 0.25 美元,估計一般工作量總成本比 Fable 5 降約 25%、高度代理式最多降約 45%。OpenAI 說快取讀寫另有費率但沒公布數字,另有 2 倍價格的 Fast mode。
安全閘會不會影響我平常寫程式?
一般寫作、分析、日常寫程式碰不到。Anthropic 說更新後的安全閘讓 Claude Code 每次工作階段的介入次數比 Fable 5 少約 60%,生物方向對良性問題誤觸發減少 85%。做防禦性資安的仍可能被中斷,OpenAI 明說 API 上被攔的任務會直接停止。
這兩家之後會開源嗎?
兩份發布頁都沒提到任何開源或釋出權重的計畫。在有官方公告之前,「即將開源」的說法都只是推測。
三分鐘行動清單
- 先確認你能拿到哪一層,別把排行榜當成你的體驗。
- 換模型前用自己的用量算一次成本,把快取比例放進去,那是兩家差最大的一項。
- 要接自動化流程,先挑一個中斷了也沒關係的工作測,尤其走 API 的。
- 做防禦性資安的,去看兩家的受信任存取計畫,不然測到的是閘後面的能力。
- 引用任何跑分之前,回官方頁把註腳讀完——這篇最關鍵的兩件事都在註腳。
延伸閱讀
- Agent Skills 是什麼?我數完 GitHub 日榜 16 個項目——能力在閉源這邊,用法在開源那邊。
- 「未來幾週」開源承諾第 19 天:實查 Meta 名下 1,074 個 Hugging Face 倉——沒有到期日的承諾怎麼查。
- openclaude 是什麼?32,041 星的 Claude Code 衍生版,授權算不算開源——標示與條款不一致時怎麼判。
參考資料
- OpenAI — GPT-6 Astra: A new generation of intelligence(定價、Critical 門檻、Daybreak、跑分表與註腳)
- Anthropic — Introducing Claude Fable 5.1 and Claude Mythos 5.1(同一模型不同安全閘、Terminal-Bench 55.8% 與 60.9%、快取降價、受信任存取計畫)
- Claude Platform Docs — Claude Fable 5.1(規格與定價)
- Claude Platform Docs — Claude Mythos 5.1(邀請制、與 Fable 5.1 共用規格與定價)
利益揭露與免責:本站部分連結為推薦連結,若你透過它們註冊,本站可能取得少量分潤,不影響你的權益與價格。本文數據取自兩家廠商 2026 年 9 月的官方發布頁與產品文件,價格、版本與存取政策變動頻繁,以官網為準。廠商跑分多為自行測試,第三方重跑前僅供方向參考。本文為資訊整理,不構成投資或採購建議。






發表迴響