2026 年 4 月 16 日,凌晨 3 點 17 分。Anthropic 的更新頁面悄悄上線一段文字。
那段文字不是行銷話術。不是「革命性突破」。不是「新時代到來」。
而是一句讓整個 AI 圈集體安靜的坦白:
「我們剛發布的 Opus 4.7,是目前市面上最強的商用 Claude。但我們內部還有一個更強的模型叫 Mythos——我們不敢放出來。」
這不是競品放話。這是 Anthropic 自己說的。
接下來 18 個小時,整個矽谷都在消化同一個念頭:最強的 AI,可能從今天起就不再是你買得到的那個。
先看 Opus 4.7 到底強到什麼程度
先把「Mythos」這個彩蛋放一邊。單看 Opus 4.7 本身的數字,已經夠狠了。
跟前一代 Opus 4.6 相比,Opus 4.7 的核心升級有五個:
| 指標 | Opus 4.6 | Opus 4.7 | 變化 |
|---|---|---|---|
| SWE-bench Verified(軟體工程基準) | ~72% | 87.6% | +15.6 pts |
| SWE-bench Pro(業界最難版本) | 53.4% | 64.3% | +10.9 pts |
| 生產環境任務解決率 | 基準 | x3(三倍) | —— |
| 視覺解析度上限 | 低解析 | 3.75MP | 質變 |
| Tokenizer | 舊版 | 全新,更高壓縮 | 省 token |
你可能對 SWE-bench Pro 這個名字陌生。它是目前公認最貼近真實軟體工程場景的測試——丟一個 GitHub 的 open issue 給模型,看它能不能自己寫出一個可以被 merge 的 PR。
64.3%。這個數字把同期的 GPT-5.4(57.7%)和 Gemini 3.1 Pro(54.2%)都甩在後面。
翻譯成白話:你丟 100 個真實工單給 Opus 4.7,它能獨立收掉 64 個。換成 GPT-5.4 是 57 個。這 7 個工單的差距,在實際工程團隊裡等於一個資深工程師的月產出。
這次真正被低估的是 xhigh
Opus 4.7 發布那天,所有報導的標題都鎖在「SWE-bench 第一」「Mythos 坦白」兩件事上。但我認為這版最被低估、對實戰影響最大的更新,是一個叫 xhigh 的推理檔位。
以前 Claude API 的 effort 參數只有 low / medium / high / max 四檔。max 是最貴、最慢、但最聰明的那一檔,處理複雜 agentic 任務時幾乎是必選——代價是 token 飆天、延遲爆表。
Opus 4.7 在 high 和 max 中間塞了一個新檔位:xhigh。官方給的定位是:
xhigh 適合進階編碼與複雜 agentic 工作,特別是需要反覆呼叫工具、長時間探索的場景。推理深度接近 max,但 token 消耗控制在合理範圍。
換算成實際使用體感:
- high:快、便宜,但長任務容易迷路。
- xhigh(新):比 high 深思,但不像 max 那樣「每個步驟都想半天」。適合 90% 的 agentic 場景。
- max:真正的「給我想到底」模式。留給最難的工作。
Anthropic 連 Claude Code 都把預設檔位改成了 xhigh。這個訊號很清楚:對大部分人來說,high 以後會是遺產設定,xhigh 才是新基準線。
如果你在用 Claude API 做 agent,記得兩件事:
- 把預設 effort 從 high 改成 xhigh,成本大概漲 1.5 倍,但任務完成率會明顯提升。
- max_tokens 設到 64k 起步。Anthropic 明說過——Opus 4.7 在 xhigh/max 模式下會頻繁觸發「自我反思」和「回溯失敗的工具路徑」,token 不夠它會卡住。
回到 Mythos——那句讓所有人坐不住的話
現在回到這篇文章真正的主角。
Anthropic 在發布 Opus 4.7 的同一天,公開承認 Mythos Preview 這個內部模型比 Opus 4.7 更強——SWE-bench Pro 77.8%,高出 Opus 4.7 整整 13.5 個百分點。
這是什麼概念?
Opus 4.7 比 GPT-5.4 強 6.6 個百分點,整個 AI 圈已經炸鍋。Mythos 比 Opus 4.7 再強 13.5 個百分點——兩代的代差。
更關鍵的是後半句:「但我們不敢放出來。」
Anthropic 給的理由是網路安全(cyber capabilities)。Opus 4.7 訓練時,他們刻意做了一件事叫「差異化降級」——把模型原本可能具備的攻擊性網路能力調低。Mythos 沒做這件事,因為做了就不是 Mythos 了。
他們補了一句:「如果你是合法的資安研究員,我們有一個正式的驗證流程可以申請用 Mythos。」
翻譯成白話:最強的 Claude,只給通過身家調查的人用。
為什麼這件事比「SWE-bench 第一」重要一百倍
過去三年,AI 的敘事一直是「平權」——大家付一樣的錢,用一樣的模型。GPT-4、Claude 3 Opus、Gemini Ultra 剛推出時,差距就是幾個百分點,大家排著隊等上架 API。
這套敘事,從今天起破功了。
Anthropic 用一次公開聲明告訴所有人:模型的能力和你能買到的能力,從此不再是同一條曲線。
未來三年,這道裂縫只會越來越深:
- 頂層(Tier 0):Mythos 這種只給特定機構(政府、金融、資安、國防)用的模型。你不知道它存在,直到有一天它出現在對手的工具鏈裡。
- 中層(Tier 1):Opus 4.7 這種商用旗艦。貴、強、大部分人買得起但用不滿。
- 底層(Tier 2):Sonnet、Haiku、Gemini Flash 這類性價比檔。夠日常使用,但碰到複雜任務會卡住。
散戶會以為自己在用最強的 AI。但其實你用的是第二強。最強的那個,正在被大機構專門訓練、專門餵資料、專門跑他們的業務。
給一般使用者的三個判斷
聊完大格局,回到你今天打開 Claude 時該想的事。
第一,Pro/Max 訂戶現在就該切 Opus 4.7。定價跟 4.6 完全一樣,但生產環境任務解決率 x3。同樣 20 美金/月的 Pro,你用 4.7 等於拿到三倍產能。用 4.6 不換的唯一理由是——你還在用舊的 prompt 模板沒來得及調。調一下,調一下。
第二,Claude Code 用戶預設就升級了,但請檢查 max_tokens。Claude Code 預設跑 xhigh,如果你還用舊的 max_tokens 設定(16k、32k),Opus 4.7 會在複雜任務中途「token 不夠卡在反思階段」。官方建議 64k 起跳。改了之後你會發現它可以跑完整個夜班,而不是半路停。
第三,開始把「我用得到 Mythos 嗎」列進你的商業決策清單。如果你是資安研究者、量化交易員、或者任何需要「最強」模型的職業,Anthropic 的驗證流程值得走一趟。申請被拒的比例不會低,但申請不到你永遠在 Tier 1 的天花板打轉。
給開發者的遷移清單
如果你是用 API 接 Claude 做產品的開發者,這幾件事本週內要做:
- 把 model 字串從
claude-opus-4-6改成claude-opus-4-7(記得先在 staging 測,tokenizer 換了)。 - effort 參數預設改
xhigh,只有很便宜的任務才降到 high。 - max_tokens 預設改 64k。長 agent 任務可以開到 96k。
- 檢查你的 prompt 有沒有用到「請一步步思考」這類手動 CoT 指令——xhigh 已經內建深度反思,手動 CoT 反而會拖累延遲。
- 如果你有用到 MCP 工具鏈,Opus 4.7 的 MCP-Atlas 分數是 77.3%——把之前 GPT 處理不好的工具呼叫任務搬過來測一次。
我的判斷:這是 AI 圈「後平權時代」的起點
把時間線拉長看,4 月 16 日這天會被記住,不是因為 SWE-bench 64.3%。
而是因為 Anthropic 首次公開承認:能力和 API 是兩條線。
OpenAI 也藏了東西——他們從 GPT-4 時代就有內部版本跑得比 API 版強,只是從來沒承認。Google DeepMind 更不用說。Anthropic 這次是把 AI 大廠心照不宣的默契攤在桌上:最強的模型,你用不到。
接下來值得盯的三個訊號:
- OpenAI 會不會跟進,公開承認他們也有內部版?
- Mythos 的「驗證程序」會不會變成下一代 AI 合規的標配?
- 中國的 DeepSeek、Kimi、百度——會不會因為沒有這層「藏模型」的機制,反而意外地對所有人開放了最強能力?
我個人偏向最後一個會發生。這可能是未來兩年 DeepSeek 還能繼續撿漏的根本原因——不是便宜,是對所有人平等。
至於 Opus 4.7 該不該升?立刻升。
至於 Mythos 什麼時候能摸到?不知道。但從今天起,你已經知道它存在了。
本文為個人觀察與分析,非投資或職涯建議。AI 模型規格與定價隨廠商政策變動,請以 Anthropic 官方公告為準。截至 2026-04-17。
延伸閱讀:更多 AI 工具與趨勢
- Claude Opus 4.8 上週四悄悄上線:1,000 個分身平行打工、Fast 模式砍到三折、奧數從 69 衝到 96 分
- Claude Mythos:Anthropic 造了一個 AI 超級駭客,然後決定不公開它
- Anthropic 做了一個 AI 駭客:幾週內找到數千個零日漏洞,只敢給 50 家公司用






發表迴響