一段《魔戒》開場白丟進去,兩個小時後吐出 5,500 行程式碼。花費約 10 美元。

一句話結論:舊的 AI 測試方法(叫模型畫一張圖)已經測不出高下,2026 年要改用「給預算、給長任務、看它能不能自己撐完兩小時」的長跑測試。

做這件事的人是 Andrej Karpathy。他是 OpenAI 創始成員、前 Tesla AI 負責人,2026 年 5 月起在 Anthropic 做預訓練研究。8 月 2 日他在 X 上貼出這個實驗,兩天內累積約 380 萬次瀏覽、2.6 萬個讚。

但真正值得看的不是那 5,500 行程式碼。是他順口提到的那句「模型看不到自己做出來的東西」。下面拆給你聽。

Karpathy 到底做了什麼實驗?

他給 Claude Opus 5 三樣東西:《魔戒》的第一段文字、100 萬 token 的預算(他自己估算約 10 美元)、一句要求「用 three.js 把它渲染出來」。three.js 是在瀏覽器裡做 3D 的一套函式庫。

然後模型自己跑了大約兩小時,寫出 5,500 行 JavaScript,用程序化的方式把中土世界的開場擺了出來:多邊形資產放進 (x, y, z) 座標、寫動畫、串場景。配音來自 ElevenLabs。8 月 3 日他把原始碼放上網,任何人都能在瀏覽器裡打開來玩、也能 fork 去改。

「我們正在離開那個用『畫一張鵜鶘騎單車的 SVG』來測 LLM 的地帶。」

Andrej Karpathy,2026 年 8 月 2 日

他自己給成果的評價是「有點粗糙但好玩」。這個誠實的形容詞很重要,後面會再提到。

「畫隻鵜鶘踩單車」是什麼測試?為什麼會過期?

這是開發者 Simon Willison 想出來的一個玩法:叫模型畫一張「鵜鶘騎腳踏車」的 SVG 向量圖。選這個題目的理由很聰明——鵜鶘的體型根本騎不了單車,這種組合在訓練資料裡幾乎不存在,模型只能靠自己拼湊。畫得出來就代表它真的懂空間關係,畫不出來就會露餡。

這個思路更早可以追到 2023 年。微軟在 Sparks of AGI 那篇論文裡,讓 GPT-4 用 TikZ 語法畫一隻獨角獸,當作純文字模型也具備空間推理能力的證據。當時的 GPT-4 只吃文字,跟現在人人都是多模態的情況不一樣。

問題是,這類題目現在的模型幾乎都能過。當所有人都考 100 分,這張考卷就沒有鑑別度了。

三代「氛圍測試」怎麼演變的

世代年份題目輸出規模真正在測什麼
第一代2023用 TikZ 畫一隻獨角獸(微軟 Sparks of AGI)幾十行純文字模型有沒有空間概念
第二代2024–2025畫一張鵜鶘騎單車的 SVG(Simon Willison)幾十到幾百行訓練資料沒有的組合,會不會硬湊
第三代2026一段《魔戒》變成 three.js 3D 場景(Karpathy)5,500 行 / 2 小時 / 約 $10長時間執行、成本紀律、自我修正

這個實驗真正證明了什麼?

三件事,重要性由低到高。

一、工作型態變了:不是一次回答,是一趟長跑

5,000 多行互相配合的 three.js 程式,不可能從一次回答裡掉出來。它需要搭鷹架、反覆擺放資產、接動畫、發現錯了再改,前後兩小時。這是一個「用預算而不是用對話輪數來界定」的任務型態,半年前基本上不存在。

二、經濟學翻轉:以前不會做的事,現在做了也不心痛

Karpathy 的原話大意是:模型有全世界的耐心。所以一件事會從「誰會閒到去做這個」變成「反正幾乎免費,做啊」。把小說裡一個段落做成客製 3D 場景,過去要一組人和一份製作排程;現在的邊際成本大約 10 美元。決策點就從「值不值得做」變成「為什麼不做」。

三、真正的瓶頸:它做得出來,但看不見自己做了什麼

這是整件事最值錢的一段,也是傳播過程中最常被跳過的一段。

模型沒辦法看自己渲染出來的影片。它只能在不同時間點截圖,慢慢看、反覆重試,過程中出錯,於是留下 Karpathy 承認的那些粗糙。他自己的總結是:agent 還沒辦法有效率地、原生地感知影片或在裡面玩遊戲。

它花兩小時蓋了一個互動作品,然後只能透過一根吸管去檢查自己蓋得對不對。

任何要跑長時間 agent 的人都會撞到這面牆。生成能力已經跑在前面,驗證能力還留在原地。

舊測試和新測試差在哪?

差在「一次生成的品質」跟「撐完一段路的能力」是兩種完全不同的東西。

維度玩具測試(鵜鶘 SVG)長跑測試(魔戒 three.js)
耗時幾秒約 2 小時
成本接近零約 10 美元(100 萬 token)
產出一張圖5,500 行可執行程式
測到的能力單次生成品質規劃、持續執行、自我修正、成本紀律
怎麼判好壞肉眼一秒要實際跑起來才知道
主要弱點模型太強就分不出高下貴、慢、很難標準化成分數

開發者社群對這件事的討論分成幾派。多數人認為鵜鶘測試本來就偏娛樂,帶預算的長篇生成是更嚴肅的壓力測試;也有人替便宜的單圖測試講話,說它至少是個幾秒就能跑完的體檢,換成多格漫畫可以同時保有速度和難度。兩邊有共識的一點是:用單一作品評斷模型的時代要結束了。

我的看法:這條推最該被打折的地方在哪?

先講立場,我覺得這個實驗很有價值。但它被轉述的方式跟它本身的內容,落差不小。

第一,Karpathy 自己說了這是 vibe check,不是 benchmark。他用的字是「有點粗糙」。但傳到中文圈的版本,多半只剩「Opus 5 兩小時寫 5,500 行」。一個沒有對照組、沒有重複實驗、沒有評分標準的單次示範,不能拿來當模型排名的依據。你可以說它有趣,不能說它證明了誰比較強。

第二,利益關係要標註出來。Karpathy 從 2026 年 5 月開始在 Anthropic 做預訓練研究,而他測的是 Anthropic 自家的 Claude Opus 5。這不代表結果造假,也不代表他不能測——實驗本身是公開的,原始碼也放出來了,任何人可以自己跑。但看的人心裡要有這條備註。X 上確實有少數人把這條推當成雇主行銷,比較站得住腳的反駁是:早了一步跟講錯了,是兩回事。

第三,也是我認為最實用的一點:這次實驗最值錢的不是它做到的事,是它做不到的那件。10 美元可以生出一個互動 3D 場景,聽起來很爽。但接下來檢查這個場景對不對、哪裡穿模、哪段動畫壞掉,還是要人一格一格看。生成成本降到 10 美元的同時,驗證成本一毛沒降。

對每天在用 AI 幹活的人來說,這句話可以直接換算:你省下來的時間,有多少會在覆核階段被吐回去。這也是為什麼我一直覺得,把輸出限制在一個「有標準答案可以驗」的形式裡(表格、程式碼、能跑的檔案),比讓 AI 自由發揮有用得多。這點在 Karpathy 講 agentic engineering 的那場演講拆解裡也講過類似的邏輯。

你現在該怎麼重新測你在用的 AI?

不用真的去渲染中土世界。把長跑測試的精神抓出來就好,五個步驟。

  1. 選一個你真的會做的任務,不要選腦筋急轉彎。你每週都要做的那件雜事最好(整理報表、寫週報、清資料、做投影片)。
  2. 把它包成一趟長跑:一次給完所有背景、規則、格式要求,然後放手讓它跑完,中間不要一直插嘴。
  3. 先訂預算再開始。決定這次最多花多少(時間或錢),跑完就停。預算是紀律,不是限制。
  4. 把驗證方式先寫好。開跑前就決定「怎樣算做完」——能不能跑、數字對不對、格式合不合。這一步最多人跳過,然後在最後花三倍時間收尾。
  5. 失敗的地方才是資訊。分清楚它是「能力不夠」還是「預算不夠」。前者要換工具,後者只要加錢。

長跑測試題產生器 + 成本試算

選你的場景,產生一段可以直接貼去用的長跑測試指令,順便估一下這趟要花多少。

除了叫它渲染 3D,還有什麼長跑測試法?

不是每個人都要看中土世界。同樣的精神可以換成這幾種,難度和成本都低很多。

  • 多格漫畫版鵜鶘:不要一張圖,要一則六格短篇,前後角色和場景要一致。保留了幾秒就能看完的優點,但同時考連貫性。
  • 可執行小工具:叫它做一個單檔 HTML 小工具。好處是驗收標準很硬——打得開、點得動、Console 沒錯就是過。
  • 資料清理長跑:丟一份髒資料,要求輸出乾淨表格加上每一步的修改紀錄。這個最貼近上班族的日常。
  • 逐步交付檢查點:把一個大任務切成幾個檢查點,看它在第 5 個檢查點還能不能記得第 1 個訂下的規則。長跑會不會走鐘,這裡看得最清楚。

共通點是:輸出要能被機器或規則驗證,不要只能靠感覺。感覺這種東西,模型比你更會迎合。

接下來該關注什麼?

三個訊號,看到了就代表這條線又往前走了一格。

  • 模型能不能看自己的輸出。目前要靠截圖,未來如果能原生讀影片、能在自己做的東西裡面操作,長跑任務的品質會直接跳一階。這是現在最明確的缺口。
  • 有沒有人把長跑做成可比較的標準。現在的長跑測試各玩各的,沒辦法排名。誰先做出一套「同題目、同預算、可重跑」的評測,誰就接手了鵜鶘的位置。
  • token 預算會不會變成標準的計價單位。如果之後大家講一個任務都用「這是一趟 50 萬 token 的活」來描述,那整個外包和報價方式都會跟著改。

常見問題

鵜鶘測試現在完全沒用了嗎?

沒有完全沒用,但鑑別度大幅下降。前段班的模型現在都畫得出來,你用它分不出誰比較好。當成三秒鐘的體檢還行,當成評比依據不行。

我要花 10 美元才能測 AI 嗎?

不用。Karpathy 那趟之所以貴,是因為他要的東西本身就大。用 20 萬 token 跑一個你日常真的會做的任務,成本大概是他的五分之一,得到的資訊對你更有用,因為那是你自己的工作。

這代表 Claude Opus 5 比其他模型強嗎?

這個實驗證不了這件事。它是單次示範,沒有對照組,Karpathy 自己也說是 vibe check。而且他目前任職於 Anthropic,測的是自家模型。要比較模型強弱,還是得看能重複、有對照的評測。

普通上班族能從這件事拿走什麼?

一個習慣的改變:不要再把 AI 當成問一句答一句的搜尋框,改成派一趟有預算、有驗收標準的活給它。同樣的工具,用法換了,產出差距會非常大。

結論

玩具測試退場,是因為模型長大了。這件事本身沒什麼好吵的。

比較值得記住的是那個不對稱:一趟兩小時的長跑生成只要 10 美元,但檢查它做得對不對,還是得靠人一格一格看。生成便宜了,驗證沒有。誰先把驗證這一段自動化,誰才真的拿到這波的紅利。

在那之前,你能做的最實際的事,是把上面那個測試題產生器跑一次,換一個你每週都要做的任務進去。你會很快知道,你現在用的那個 AI,到底是撐得完兩小時,還是只撐得完兩句話。

延伸閱讀:AI 花 $2,000 解決 10 條數學懸案,但沒人告訴你它「沒有」證明什麼claude-howto:9,700 星的 Claude Code 教學地圖

資料時效:本文內容截至 2026 年 8 月 4 日。AI 模型與定價變動極快,文中的 token 價格為原作者自行估算,實際費用請以你的服務商帳單為準。本文為資訊整理與個人觀點分享,不構成任何投資或採購建議。文中提及的實驗由 Andrej Karpathy 於 2026 年 8 月 2 日公開發表,他自 2026 年 5 月起任職於 Anthropic。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash