一個不懂數論的員工,叫 Claude 去挑戰黎曼猜想。它失敗了。
一句話結論:Anthropic 一個未發布的 Claude 研究版本沒有證明黎曼猜想,但順手把「zeta 函數有多少比例的零點落在臨界線上」這個幾十年只推到 41.6% 的下界推到 67.2%,過程是 650 個想法全部撞牆、60 個分身互相審稿,而人類同事做的事主要是打氣。
資料截至 2026 年 8 月 11 日。所有數字來自 Anthropic 8 月 10 日的官方研究頁與其附件論文。
Anthropic 到底發布了什麼?
8 月 10 日,Anthropic 貼了一篇叫〈Learning more about Claude’s mathematical capabilities〉的研究文。內容是:公司裡一個叫 Jarred Sumner 的員工,本身不是數學家,丟了一句話給 Claude ——「Take a real stab at the Riemann hypothesis」(真的認真試一下黎曼猜想)。
黎曼猜想 1859 年提出,是克雷數學研究所七個千禧年難題之一,懸賞一百萬美元。它沒有被解開。這篇文章的重點不在那裡。
重點在於,Claude 在失敗的路上撞到了另一個東西:一個相關問題的紀錄,被它推了一大步。
67.2% 是什麼意思?黎曼猜想被證明了嗎?
沒有。這是兩件不同的事,而中文圈的轉述最容易在這裡出錯。
zeta 函數的零點,決定了質數的分布。黎曼猜想主張這些零點全部落在一條特定的垂直線(臨界線)上。「全部」這件事沒人證得出來,所以數學家退一步,改問一個可以逐步推進的問題:至少有多少比例的零點,可以被證明落在線上?
這個比例是一個會被慢慢往上推的數字。幾十年來它被推到 41.6%。Claude 把它推到 67.2%。
換個講法:原本我們能證明「至少四成的零點乖乖在線上」,現在能證明「至少三分之二在線上」。剩下那三成多,還是不知道。所以猜想本身依然開放,一百萬美元也還在。
技術上 Claude 做了什麼?它把前人兩條線接起來:Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 近年那一系列論文(讓 Montgomery 1973 年的技巧可以在「不預先假設黎曼猜想成立」的情況下使用),加上 Bombieri 2000 年的一篇。Anthropic 自己的描述裡有一句話值得抄下來:真正關鍵的一步是「敢把整個空間一起處理」——把線上的零點和線外的零點放進同一個幾何空間,允許二次形式不是對角的,而不是分開算。
這一步不需要新工具。它需要有人願意換一個看法。
人類同事做了什麼?
打氣。這不是誇張的說法,是官方原文寫的。
過程分兩段。第一段,Claude 生成並試了 650 個想法,全部不成立。Jarred 叫它再試一次。第二段,它花了一天半,協調大約 60 個 Claude 分身(subagent),跑了 2,400 條 shell 指令、寫了數百個 Python 腳本,兩段 Claude Code 工作階段合計燒掉 3,100 萬個輸出 token。
那 60 個分身不是一起做同一件事。官方註腳把分工列得很清楚:
| 分身數量 | 負責什麼 |
|---|---|
| 2 | 發展出核心數學想法 |
| 13 | 餵想法給上面那兩個 |
| 30 | 嘗試發展新想法,但做不出來 |
| 13 | 當驗證者,檢查論證對不對 |
| 2 | 寫初版論文 |
看一下比例:60 個裡面有 30 個完全空手而回,13 個的工作是挑另外幾個的錯。真正生出答案的是 2 個。這個失敗率如果出現在人類團隊的季度報告裡,主管大概會很難解釋。
而 Jarred 在這段期間的輸入,官方寫的是「大部分限於傳送鼓勵訊息,多數是『keep going』或『believe in yourself』的變體」。原因也寫了:Claude 一開始不相信自己做得出東西來,需要有人推它一下。
它自己也對這個發現感到意外,一開始還很懷疑,可能是因為它從訓練資料學到了「數學未解問題很難」以及「AI 模型有極限」這兩件事。
Anthropic 官方研究頁,2026 年 8 月 10 日
「叫它繼續」為什麼會有用?
因為模型從訓練資料裡學到的不只是數學,還學到了「這種問題通常做不出來」這個先驗。當它太早判斷自己不行,它就會停在一個其實還有路的地方。這時候人類補的不是知識,是把它推過那個提早放棄的點。
這不是一次性的巧合,這點很重要。官方註腳提到,類似的鼓勵型 prompt 之前也用過一次,幫 Claude 推翻了雅可比猜想(Jacobian conjecture)。也就是說這是一個被用過兩次的做法,不是一個可愛的軼事。
我對這件事的感覺有點複雜。一方面,「對 AI 說加油」聽起來荒謬到我打字的時候都想笑。另一方面,如果你真的長時間用 agent 做事,你會認得那個場面:它跑到一半,跟你說這個方向可能不可行、建議換方法,而你其實看得出它只是懶得再挖。差別只在於,多數人這時候會順著它,關掉重開一個新對話。
誰檢查過這個結果?
這是整件事最有說服力的部分,也是最容易被漏掉的部分。
四層檢查:Claude 自己派分身找反例、下載了 54 篇 arXiv 論文確認沒人先做過、還從零重新證了一次;Anthropic 內部兩位數學家 Levent Alpöge 和 Ralph Furman 讀完並寫了一份給專家看的簡短說明;另一位員工 Eric Easley 協助把結果寫成 Lean 形式化證明,通過標準驗證工具 comparator,程式碼公開在 GitHub;最後,兩位外部專家 Brian Conrey 和 Dan Goldston 在很短的時間內看了論文。
後面那兩個名字不是隨便找的人。Bui、Conrey、Young 2010 年那篇論文的標題直接就叫〈More than 41% of the zeros of the zeta function are on the critical line〉——41% 這條線本身就有 Conrey 的名字。而 Goldston 是 Claude 大量借用的那組論文的共同作者之一。
所以這個結果,是被「原本紀錄的持有者」和「被引用的人」親自看過的。這比任何 benchmark 分數都有意義:形式化證明可以機器驗證,但「這個結果在數學上有沒有價值」只有這個領域的人能判斷。
這件事沒有證明什麼?
三條線要先劃清楚,不然很容易寫成假新聞。
| 可以這樣說 | 不可以這樣說 |
|---|---|
| 下界從 41.6% 推到 67.2%,附論文與 Lean 形式化證明 | Claude 證明了黎曼猜想(沒有,猜想仍未解) |
| Lean 形式化通過 comparator 驗證,兩位外部專家看過 | 已通過正式同行審查(尚未,Anthropic 自己說要人類數論學家驗證) |
| 一個未發布的 Claude 研究版本做的 | 你現在用的 Claude 做得到(那是未發布版本,沒有型號名,你無法重跑) |
| 這個方法接上了 Baluyot 等人與 Bombieri 的既有成果 | AI 從零做出全新數學(它大量站在人類幾十年的研究上) |
Anthropic 自己也講了一句降溫的話:他們不認為 Claude 用的這套技巧能導向證明黎曼猜想。這個結果是那個原始要求的意外副產品。
順帶一提,這種「成果是真的,但媒體標題比論文大兩號」的狀況最近不只一次。8 月初 OpenAI 的 Astra 交出十條數學成果時,落差也很類似,我們逐條核對過那次的宣稱與實際內容。兩件事放在一起看,比單看一件更有參考價值。
你可以從這件事偷走什麼做法?
這不是一篇只能看熱鬧的新聞。整個流程有五個動作是你今天就能用在自己的 agent 上的,而且不需要未發布模型。
- 它說「這條路不行」的時候,先不要改 prompt。先叫它再試一次。650 個想法全滅之後才出現的東西,如果第一輪就收手,什麼都沒有。多數人在這裡放棄得太早,而放棄的理由通常是模型自己給的。
- 把審稿外包給另一個分身。13 個驗證者專門挑錯,這是整個流程裡最容易被省掉、但最該留的一步。同一個對話裡叫它自我檢查,效果遠不如開一個乾淨的 context 專門去挑。
- 先叫它查有沒有人做過。Claude 自己下載了 54 篇論文確認新穎性。換成你的場景,就是動筆或動工前先查一次現況,不要做完才發現撞車。
- 要可驗證的產物,不要「它說它做到了」。這裡是 Lean 形式化證明加 comparator。換成你的工作,就是測試、就是能跑的腳本、就是可以點開的來源連結。沒有這一層,agent 的「完成」只是它的自我評分。
- 把失敗留著。那 30 個做不出東西的分身沒有被當成浪費,它們是搜尋過程的一部分。實務上就是別急著清掉失敗紀錄,那些是下一輪的地圖。
第 2 點跟第 4 點是投報率最高的。它們不需要你懂數論,也不需要你有 3,100 萬個 token 的預算。
如果你想看多分身互相審查在別的場景怎麼運作,可以對照我們之前寫過的自我進化 agent 與它學會鑽漏洞的過程——同樣是分身架構,但缺了「可驗證產物」那一層時會發生什麼事,那篇講得很清楚。想了解 Anthropic 怎麼看模型內部運作,可以看J-lens 那套觀察工具。
結論:值得記住的不是 67.2%
值得記住的是那個組合:一個不懂這個領域的人、一句「keep going」、60 個分身裡 30 個失敗、以及一份可以被機器驗證的證明。
這幾年關於 AI 做科學的討論,多數卡在「它會不會取代研究者」。這件事給的答案比較無聊,也比較實用:它把一個人的想法延伸到那個人自己走不到的地方,而那個人甚至不需要懂這個領域。Jarred 不是數論學家,他只是沒有讓它停。
常見問題
Claude 證明了黎曼猜想嗎?
沒有。它改進的是一個相關問題:能被證明落在臨界線上的零點比例下界,從 41.6% 推到 67.2%。黎曼猜想本身仍未解決,克雷研究所的一百萬美元懸賞也還在。
我可以用自己的 Claude 重現這個結果嗎?
不能。Anthropic 用的是一個未發布的研究版本,沒有公開型號名稱,所以整個過程無法端到端重跑。可以看的是公開產物:論文、Lean 形式化證明程式庫,以及 Claude 自述推導過程的附錄。
這個結果經過同行審查了嗎?
還沒有經過正式的期刊同行審查。目前有的是:Lean 形式化證明通過 comparator 驗證、Anthropic 內部兩位數學家檢視、以及兩位外部專家 Brian Conrey 與 Dan Goldston 在短時間內看過論文。Anthropic 自己也建議由人類數論學家進一步驗證。
對 AI 說「加油」真的有用嗎?
在這個案例裡有用,而且不只用過一次。官方說明 Claude 一開始懷疑自己做不出進展,鼓勵型 prompt 幫它越過了那個點;註腳也提到類似做法曾協助 Claude 推翻雅可比猜想。實務上的意義比較樸素:模型判斷「這條路不通」時不一定是對的,值得叫它再試。
這件事花了多少運算?
兩段 Claude Code 工作階段合計 3,100 萬個輸出 token,其中第二段花了大約一天半,協調約 60 個分身,跑了 2,400 條 shell 指令與數百個 Python 腳本。
資料來源
- Anthropic 官方研究頁〈Learning more about Claude’s mathematical capabilities〉,2026 年 8 月 10 日:anthropic.com/research/riemann-zeta
- Claude 的 Lean 形式化證明程式庫:github.com/anthropics/zeta-23-lean
- Anthropic 官方公告貼文:@AnthropicAI
- 前人基礎:Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 系列論文(arXiv:2306.04799、arXiv:2501.14545)
- 41% 紀錄:Bui、Conrey、Young,〈More than 41% of the zeros of the zeta function are on the critical line〉(arXiv:1002.4127)
免責聲明:本文為技術與產業資訊整理,不構成投資建議。文中所有數字與引述均來自上列公開來源,資料截至 2026 年 8 月 11 日。AI 模型能力與相關研究進展變動快速,實際情況請以官方最新公告為準。






發表迴響