九月四日下午兩點二十一分,Anthropic 開了一個 GitHub 倉庫。三十八分鐘後,最後一次 push,然後再也沒有動過。四天後,OpenAI 也開了一個。這次只撐了七分鐘。

一句話結論:要判斷 AI 數學證明可不可信,不必看新聞稿——去看倉庫本身。我逐項查了這兩個 Lean 倉庫的 12 個欄位,其中 OpenAI 那個的 formalization.yaml 自己標著 review: self-assessed

過去一週,中文圈的標題大致是兩句:「AI 證明了費馬大定理」、「AI 攻克千禧年大獎難題」。兩句都有出處,也都不完全對——而糾正它們的證據,就寫在兩家公司自己的官方頁面和倉庫檔案裡。以下所有數字,都是 2026 年 9 月 10 日直接打 GitHub API 取的實查值,不是轉述新聞。

這四天到底發生了什麼?

照時間順序排,是三組人、四件事:

  1. 9 月 4 日:Anthropic 發布〈Formalizing Fermat’s Last Theorem〉,同日開出 anthropics/fermats-last-theorem 倉庫。
  2. 9 月 7 日:數學家 Levent Alpöge 與 Tristan Buckmaster 公開三份預印本,內容是三條方程的「有外力有限時間爆破」,附 Lean 形式化。同日 Terence Tao 寫了一篇解讀。
  3. 9 月 8 日:OpenAI 發布〈On the Navier–Stokes Millennium Prize Problem〉,同日開出 openai/NavierStokesAndEuler 倉庫。Quanta Magazine 的標題是〈AI Has Solved One of Math’s $1 Million Millennium Prize Problems〉,中文圈的轉述大多從這一層開始。

三件事被壓進同一週,於是被當成同一件事講。它們不是。

兩個倉庫逐項對照,差在哪?

差在「誰來核」。以下 12 個欄位全部來自 GitHub API 與倉庫內的檔案,2026-09-10 實查:

欄位anthropics/
fermats-last-theorem
openai/
NavierStokesAndEuler
1. 建立時間(UTC)2026-09-04 14:21:042026-09-08 10:53:38
2. 最後 push2026-09-04 14:59:12(建立後 38 分鐘2026-09-08 11:00:49(建立後 7 分鐘
3. Star1,0031,586
4. Fork83148
5. Watcher1239
6. .lean 檔數45,938(樹狀清單已被 API 截斷;README 自報 60,475 個 module)2,486
7. .lean 體積1.02 GB約 32.4 MB
8. 授權Apache-2.0Apache-2.0
9. 自報 sorry(未證的洞)00
10. 第三方核對工具comparator + nanoda(獨立的 Rust 版 Lean 核心,另跑 1,052,234 個宣告)comparator challenges(倉庫內有提供設定)
11. 自報 review 狀態README 記述三重驗證formalization.yamlreview: status: "self-assessed"
12. 產出模型官方稱「大致相當於 Claude Fable 5.1」的內部研究模型yaml 標 GPT-6 Astra/Codex;官方文章稱主證明用「明顯強於 GPT-6 Astra」的內部模型

第 10 和第 11 列最值得停下來看。Anthropic 做了一件很麻煩、但對信任度很有用的事:除了 Lean 自己的核心,還把整個環境匯出去餵給 nanoda——一個用 Rust 另外寫的 Lean 核心。用另一套獨立實作再驗一次,是為了防「Lean 自己有 bug,所以自己驗自己過關」。

OpenAI 則提供了 comparator 挑戰檔讓讀者自己跑,但它的中繼資料檔把 review 狀態寫成 self-assessed——這不是別人的指控,是它自己填的欄位。

為什麼「開倉七分鐘後就凍結」值得注意?

因為它說明這兩個倉庫不是專案,是成績單

一般開源專案會持續有 commit、有 issue 討論、有版本發布。這兩個都沒有:建立當天推完就停,之後沒再動。Anthropic 的 README 甚至直接寫明「Research artifact. Not maintained and not accepting contributions.」(研究產物,不維護,不接受貢獻)。

看 GitHub 上的 AI 成果,先看 created_atpushed_at 差多久。差幾分鐘的,是發表用的附件;差幾個月還在動的,才是工具。兩者要用完全不同的標準去讀。

這也解釋了 star 數為什麼「不高」。1,003 和 1,586 放在動輒破十萬星的工具倉庫旁邊看起來很小,但兩者根本不在同一個賽道——沒有人會拿一份證明檔案來日常使用。

「AI 證明了費馬大定理」這句話錯在哪?

錯在把「形式化」講成「證明」。指出這件事的,是 Anthropic 自己。

官方文章原文寫得很直接:「what’s novel here is the verification——新的是驗證,不是數學。費馬大定理由 Andrew Wiles 在 1995 年證明,Claude 走的是 Frey、Serre、Ribet、Wiles、Taylor 這條既有路線,照 Darmon–Diamond–Taylor 的簡化版本。

更值得看的是倉庫裡那份 ATTRIBUTION.md。它逐檔列出 106 個檔案取材自人類社群的既有成果:其中 90 個來自 Kevin Buzzard 在 Imperial College London 主持的 FLT 專案,其餘來自 flt-regular。那份檔案還交代了一句很少人注意的話:這些 Lean 檔「由 AI agent 組裝,發布時去掉了註解」,上游版權標頭沒留在原處,只能事後逐行比對還原。

換句話說:AI 做的是把一個人類已經確立、而且社群已經鋪了地基的證明,翻譯成機器能逐步查核的形式——並且在 11 天內做完了原本預計要好幾年的工程。這件事本身已經夠大,不需要再誇成「AI 想出了證明」。

Kevin Buzzard 本人看過之後給了 Anthropic 一段評價,重點也落在同一處:這證明了 AI 自動形式化的產物「已經穩固到可以被拿來繼續往上蓋」。

「AI 拿下千禧年大獎」這句話又錯在哪?

錯在兩個地方,兩個都寫在 OpenAI 自己的頁面上。

第一,OpenAI 說了不領。原文:「We do not intend to claim the Millennium Prize for this result.」(我們不打算為這個結果申請千禧年大獎。)

第二,也是更技術性的一點:這個結果是「有外力」的版本。Clay 研究所的官方題目有四個選項,(A)(B) 是證明解永遠平滑,(C)(D) 是證明會崩潰。OpenAI 主張成立的是 (C) 和 (D)——而它的成立條件包含「有一個平滑的外力施加在流體上」。官方頁面自己的描述是:一開始靜止的平滑流體,加上平滑外力,能量全程有限,在有限時間內產生奇點。

同一個倉庫裡的 Euler 結果反而是無外力的,那個在數學上更難。OpenAI 也把兩者分得很清楚:Euler 那份用了約 100 個 agent、約 50 小時;Navier–Stokes 那份用了約 10,000 個並行 agent、88 小時,再花 17 小時用 GPT-6 Astra 做 Lean 形式化。

「有外力」算不算解決千禧年問題?形式上,(C)(D) 確實列在官方四個選項裡。但它跟大眾腦中「水流自己爆炸」的版本不是同一件事,而標題不會告訴你這個區別。

同一週還有第三組人,他們證的是什麼?

這是整件事最容易被壓掉的一層。

9 月 7 日,Levent Alpöge 與 Tristan Buckmaster 公開了三份預印本,證的是三條方程的有外力有限時間爆破:不可壓縮多孔介質方程(IPM)、二維 Boussinesq 系統、三維不可壓縮 Euler 方程,並附上 Lean 形式化。Terence Tao 當天寫了解讀,他的評價非常克制:

「While these authors do not quite achieve these goals yet, they have made enough of a breakthrough that it looks very feasible to complete these goals in the near future.」(這些作者還沒有完全達成這些目標,但突破已經大到讓人覺得近期內完成很有機會。)

也就是說:這一組做的是三條模型方程,Navier–Stokes 本身沒有被他們證掉。Tao 對 AI 的角色只寫了一句話——「the arguments here are heavily AI-assisted」(這裡的論證大量借助 AI),沒有點名任何模型,也沒有給人機比例。

Tao 另外提到,這兩位作者是被迫提前釋出未打磨完的預印本的:「they were forced to release their preliminary preprints before they were completely digested and polished, due to external events」。那是什麼事件,他沒有說。

OpenAI 那邊則在文章的「Concurrent work」一節主動交代:他們 9 月 1 日聽到的傳聞,後來確認與 Alpöge(Anthropic 員工)和 Buckmaster(NYU 教授)有關,並承認對方在有外力 Euler 上的優先權。

⚠️ 這場優先權爭議還有更激烈的說法,但那些出現在部落格留言區,不是任何一方的正式文件。本文只採用三方官方頁面與 Tao 正文的內容,留言區指控一律不引用。

你自己可以怎麼驗?

形式化證明最好的地方,就是它不需要你相信任何人。以下三步不用會數學,只要會開網頁:

  1. 看它敢不敢釘死公理清單。打開 FinalCheck.lean。Anthropic 那份寫著 #print axioms fermat_last_theorem,並用 #guard_msgs 規定輸出必須剛好是 [propext, Classical.choice, Quot.sound] 這三條 Lean 標準公理。只要有人偷加一條公理或留一個洞,這個建置就會失敗。
  2. sorry在 Lean 裡,sorry 表示「這一步我先跳過」。整個證明只要有一個 sorry,結論就不成立。兩個倉庫都自報 0(OpenAI 寫在 formalization.yamlsorry_count,Anthropic 寫在 README),而這是可以自己搜來驗證的。
  3. 看它的定理敘述是不是「原本那題」。這是最容易被忽略、也最容易造假的一環——你可以證明一個「看起來像」費馬大定理但其實被偷偷放寬過的敘述。comparator 這個工具就是專門對付這件事的:它比對你證的敘述和標準函式庫的敘述是不是逐字相同。兩個倉庫都提供了 comparator 設定。

把這三步套回上面那張表,你會發現真正的差別不在 star 數,而在第 10、11 兩列。

AI 數學證明可信度自查表

下次再看到「AI 證明了 XX」,逐項打勾:

請開始勾選。

純前端計算,不會傳送任何資料。

這對一般讀者意味著什麼?

意味著判斷 AI 成果的方法,正在從「看它說什麼」變成「看它敢不敢被機器查」。

Anthropic 的文章裡有一段沒什麼人引用、但其實是整件事的重點:Wiles 1995 年那份 129 頁的證明,人工審查花了好幾個月,中途被審稿人抓出一個關鍵漏洞,Wiles 補了一年才補好。Thomas Hales 的 Kepler 猜想證明審了四年,12 位審稿人最後給的結論是「99% 確定」。

當 AI 開始大量產出「疑似證明」,人工審查這條路一定塞爆。形式化是目前唯一看得到的出口——它不是讓 AI 更聰明,而是把「要不要相信這個結果」從社會問題變回一個可以跑的計算。

一條可以抄下來的判準:成果的可信度不看發布方多大牌,看它把多少驗證權交到讀者手上。Anthropic 交出三套核對、逐檔取材清單,還把整份證明做成可離線瀏覽的網頁;OpenAI 交出 comparator 挑戰檔,但 review 狀態自報 self-assessed。兩者都比只發一份 PDF 好,但交出去的權限不一樣多。

至於「AI 會不會取代數學家」——這一週的證據指向另一個方向。Anthropic 的專案靠的是 Kevin Buzzard 團隊鋪的地基(106 個檔案有出處)、Mathlib 背後幾百位數學家的貢獻,以及 Tianyi Peng 團隊做的 Prove2Me 協作平台。人類輸入的是高層指令,例如「Jacobian 當成 scheme 處理,優先度高」。這比較像是有人終於能把一支很大的施工隊指揮起來,而不是工地自己長出了一棟樓。

常見問題

AI 真的證明了費馬大定理嗎?

沒有。費馬大定理是 Andrew Wiles 在 1995 年證明的。Anthropic 做的是「形式化」——把既有證明翻譯成 Lean 這種電腦能逐步查核的語言,11 天完成,產出約 1,300 萬行 Lean、29,500 個中間定理。Anthropic 官方原文自己寫明新的是「驗證」而不是「數學」。

OpenAI 是不是拿到千禧年大獎的一百萬美元了?

沒有,而且 OpenAI 明講不打算申請。Clay 研究所的規則本來就要求先在正式期刊發表、再經過約兩年的社群檢驗。另外要注意 OpenAI 主張的是官方四選項裡的 (C)(D),成立條件包含「有平滑外力」。

Lean 是什麼?為什麼大家都在用它?

Lean 是一種「證明助理」語言:你把數學論證寫成程式,Lean 的核心會逐步檢查每一步是否合法,不能跳步。它的價值不在於幫你想出證明,而在於一旦通過檢查,正確性就不再依賴任何人的信譽。這正是 AI 大量產出證明時最需要的東西。

倉庫裡的 sorry 是什麼意思?

sorry 是 Lean 的佔位符,意思是「這一步先跳過不證」。只要證明裡還有任何一個 sorry,整個結論就不成立。所以看一份 Lean 證明,第一件事就是搜 sorry。這兩個倉庫都自報 0。

一手來源(本文所有數據的出處)

延伸閱讀

本文所有倉庫數據為 2026 年 9 月 10 日透過 GitHub API 實查值,官方說法引自 openai.com、anthropic.com 與 terrytao.wordpress.com 的原始頁面。AI 領域變動極快,數據可能隨時間變化,請以官方最新公告為準。本文僅為資訊整理與方法討論,不構成任何投資或專業建議。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash