一個不懂數論的員工,叫 Claude 去挑戰黎曼猜想。它失敗了。

一句話結論:Anthropic 一個未發布的 Claude 研究版本沒有證明黎曼猜想,但順手把「zeta 函數有多少比例的零點落在臨界線上」這個幾十年只推到 41.6% 的下界推到 67.2%,過程是 650 個想法全部撞牆、60 個分身互相審稿,而人類同事做的事主要是打氣。

資料截至 2026 年 8 月 11 日。所有數字來自 Anthropic 8 月 10 日的官方研究頁與其附件論文。

Anthropic 到底發布了什麼?

8 月 10 日,Anthropic 貼了一篇叫〈Learning more about Claude’s mathematical capabilities〉的研究文。內容是:公司裡一個叫 Jarred Sumner 的員工,本身不是數學家,丟了一句話給 Claude ——「Take a real stab at the Riemann hypothesis」(真的認真試一下黎曼猜想)。

黎曼猜想 1859 年提出,是克雷數學研究所七個千禧年難題之一,懸賞一百萬美元。它沒有被解開。這篇文章的重點不在那裡。

重點在於,Claude 在失敗的路上撞到了另一個東西:一個相關問題的紀錄,被它推了一大步。

67.2% 是什麼意思?黎曼猜想被證明了嗎?

沒有。這是兩件不同的事,而中文圈的轉述最容易在這裡出錯。

zeta 函數的零點,決定了質數的分布。黎曼猜想主張這些零點全部落在一條特定的垂直線(臨界線)上。「全部」這件事沒人證得出來,所以數學家退一步,改問一個可以逐步推進的問題:至少有多少比例的零點,可以被證明落在線上?

這個比例是一個會被慢慢往上推的數字。幾十年來它被推到 41.6%。Claude 把它推到 67.2%。

換個講法:原本我們能證明「至少四成的零點乖乖在線上」,現在能證明「至少三分之二在線上」。剩下那三成多,還是不知道。所以猜想本身依然開放,一百萬美元也還在。

技術上 Claude 做了什麼?它把前人兩條線接起來:Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 近年那一系列論文(讓 Montgomery 1973 年的技巧可以在「不預先假設黎曼猜想成立」的情況下使用),加上 Bombieri 2000 年的一篇。Anthropic 自己的描述裡有一句話值得抄下來:真正關鍵的一步是「敢把整個空間一起處理」——把線上的零點和線外的零點放進同一個幾何空間,允許二次形式不是對角的,而不是分開算。

這一步不需要新工具。它需要有人願意換一個看法。

人類同事做了什麼?

打氣。這不是誇張的說法,是官方原文寫的。

過程分兩段。第一段,Claude 生成並試了 650 個想法,全部不成立。Jarred 叫它再試一次。第二段,它花了一天半,協調大約 60 個 Claude 分身(subagent),跑了 2,400 條 shell 指令、寫了數百個 Python 腳本,兩段 Claude Code 工作階段合計燒掉 3,100 萬個輸出 token。

那 60 個分身不是一起做同一件事。官方註腳把分工列得很清楚:

分身數量負責什麼
2發展出核心數學想法
13餵想法給上面那兩個
30嘗試發展新想法,但做不出來
13當驗證者,檢查論證對不對
2寫初版論文

看一下比例:60 個裡面有 30 個完全空手而回,13 個的工作是挑另外幾個的錯。真正生出答案的是 2 個。這個失敗率如果出現在人類團隊的季度報告裡,主管大概會很難解釋。

而 Jarred 在這段期間的輸入,官方寫的是「大部分限於傳送鼓勵訊息,多數是『keep going』或『believe in yourself』的變體」。原因也寫了:Claude 一開始不相信自己做得出東西來,需要有人推它一下。

它自己也對這個發現感到意外,一開始還很懷疑,可能是因為它從訓練資料學到了「數學未解問題很難」以及「AI 模型有極限」這兩件事。

Anthropic 官方研究頁,2026 年 8 月 10 日

「叫它繼續」為什麼會有用?

因為模型從訓練資料裡學到的不只是數學,還學到了「這種問題通常做不出來」這個先驗。當它太早判斷自己不行,它就會停在一個其實還有路的地方。這時候人類補的不是知識,是把它推過那個提早放棄的點。

這不是一次性的巧合,這點很重要。官方註腳提到,類似的鼓勵型 prompt 之前也用過一次,幫 Claude 推翻了雅可比猜想(Jacobian conjecture)。也就是說這是一個被用過兩次的做法,不是一個可愛的軼事。

我對這件事的感覺有點複雜。一方面,「對 AI 說加油」聽起來荒謬到我打字的時候都想笑。另一方面,如果你真的長時間用 agent 做事,你會認得那個場面:它跑到一半,跟你說這個方向可能不可行、建議換方法,而你其實看得出它只是懶得再挖。差別只在於,多數人這時候會順著它,關掉重開一個新對話。

誰檢查過這個結果?

這是整件事最有說服力的部分,也是最容易被漏掉的部分。

四層檢查:Claude 自己派分身找反例、下載了 54 篇 arXiv 論文確認沒人先做過、還從零重新證了一次;Anthropic 內部兩位數學家 Levent Alpöge 和 Ralph Furman 讀完並寫了一份給專家看的簡短說明;另一位員工 Eric Easley 協助把結果寫成 Lean 形式化證明,通過標準驗證工具 comparator,程式碼公開在 GitHub;最後,兩位外部專家 Brian Conrey 和 Dan Goldston 在很短的時間內看了論文。

後面那兩個名字不是隨便找的人。Bui、Conrey、Young 2010 年那篇論文的標題直接就叫〈More than 41% of the zeros of the zeta function are on the critical line〉——41% 這條線本身就有 Conrey 的名字。而 Goldston 是 Claude 大量借用的那組論文的共同作者之一。

所以這個結果,是被「原本紀錄的持有者」和「被引用的人」親自看過的。這比任何 benchmark 分數都有意義:形式化證明可以機器驗證,但「這個結果在數學上有沒有價值」只有這個領域的人能判斷。

這件事沒有證明什麼?

三條線要先劃清楚,不然很容易寫成假新聞。

可以這樣說不可以這樣說
下界從 41.6% 推到 67.2%,附論文與 Lean 形式化證明Claude 證明了黎曼猜想(沒有,猜想仍未解)
Lean 形式化通過 comparator 驗證,兩位外部專家看過已通過正式同行審查(尚未,Anthropic 自己說要人類數論學家驗證)
一個未發布的 Claude 研究版本做的你現在用的 Claude 做得到(那是未發布版本,沒有型號名,你無法重跑)
這個方法接上了 Baluyot 等人與 Bombieri 的既有成果AI 從零做出全新數學(它大量站在人類幾十年的研究上)

Anthropic 自己也講了一句降溫的話:他們不認為 Claude 用的這套技巧能導向證明黎曼猜想。這個結果是那個原始要求的意外副產品。

順帶一提,這種「成果是真的,但媒體標題比論文大兩號」的狀況最近不只一次。8 月初 OpenAI 的 Astra 交出十條數學成果時,落差也很類似,我們逐條核對過那次的宣稱與實際內容。兩件事放在一起看,比單看一件更有參考價值。

你可以從這件事偷走什麼做法?

這不是一篇只能看熱鬧的新聞。整個流程有五個動作是你今天就能用在自己的 agent 上的,而且不需要未發布模型。

  1. 它說「這條路不行」的時候,先不要改 prompt。先叫它再試一次。650 個想法全滅之後才出現的東西,如果第一輪就收手,什麼都沒有。多數人在這裡放棄得太早,而放棄的理由通常是模型自己給的。
  2. 把審稿外包給另一個分身。13 個驗證者專門挑錯,這是整個流程裡最容易被省掉、但最該留的一步。同一個對話裡叫它自我檢查,效果遠不如開一個乾淨的 context 專門去挑。
  3. 先叫它查有沒有人做過。Claude 自己下載了 54 篇論文確認新穎性。換成你的場景,就是動筆或動工前先查一次現況,不要做完才發現撞車。
  4. 要可驗證的產物,不要「它說它做到了」。這裡是 Lean 形式化證明加 comparator。換成你的工作,就是測試、就是能跑的腳本、就是可以點開的來源連結。沒有這一層,agent 的「完成」只是它的自我評分。
  5. 把失敗留著。那 30 個做不出東西的分身沒有被當成浪費,它們是搜尋過程的一部分。實務上就是別急著清掉失敗紀錄,那些是下一輪的地圖。

第 2 點跟第 4 點是投報率最高的。它們不需要你懂數論,也不需要你有 3,100 萬個 token 的預算。

如果你想看多分身互相審查在別的場景怎麼運作,可以對照我們之前寫過的自我進化 agent 與它學會鑽漏洞的過程——同樣是分身架構,但缺了「可驗證產物」那一層時會發生什麼事,那篇講得很清楚。想了解 Anthropic 怎麼看模型內部運作,可以看J-lens 那套觀察工具

結論:值得記住的不是 67.2%

值得記住的是那個組合:一個不懂這個領域的人、一句「keep going」、60 個分身裡 30 個失敗、以及一份可以被機器驗證的證明。

這幾年關於 AI 做科學的討論,多數卡在「它會不會取代研究者」。這件事給的答案比較無聊,也比較實用:它把一個人的想法延伸到那個人自己走不到的地方,而那個人甚至不需要懂這個領域。Jarred 不是數論學家,他只是沒有讓它停。

常見問題

Claude 證明了黎曼猜想嗎?

沒有。它改進的是一個相關問題:能被證明落在臨界線上的零點比例下界,從 41.6% 推到 67.2%。黎曼猜想本身仍未解決,克雷研究所的一百萬美元懸賞也還在。

我可以用自己的 Claude 重現這個結果嗎?

不能。Anthropic 用的是一個未發布的研究版本,沒有公開型號名稱,所以整個過程無法端到端重跑。可以看的是公開產物:論文、Lean 形式化證明程式庫,以及 Claude 自述推導過程的附錄。

這個結果經過同行審查了嗎?

還沒有經過正式的期刊同行審查。目前有的是:Lean 形式化證明通過 comparator 驗證、Anthropic 內部兩位數學家檢視、以及兩位外部專家 Brian Conrey 與 Dan Goldston 在短時間內看過論文。Anthropic 自己也建議由人類數論學家進一步驗證。

對 AI 說「加油」真的有用嗎?

在這個案例裡有用,而且不只用過一次。官方說明 Claude 一開始懷疑自己做不出進展,鼓勵型 prompt 幫它越過了那個點;註腳也提到類似做法曾協助 Claude 推翻雅可比猜想。實務上的意義比較樸素:模型判斷「這條路不通」時不一定是對的,值得叫它再試。

這件事花了多少運算?

兩段 Claude Code 工作階段合計 3,100 萬個輸出 token,其中第二段花了大約一天半,協調約 60 個分身,跑了 2,400 條 shell 指令與數百個 Python 腳本。

資料來源

免責聲明:本文為技術與產業資訊整理,不構成投資建議。文中所有數字與引述均來自上列公開來源,資料截至 2026 年 8 月 11 日。AI 模型能力與相關研究進展變動快速,實際情況請以官方最新公告為準。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash