一段《魔戒》開場白丟進去,兩個小時後吐出 5,500 行程式碼。花費約 10 美元。
一句話結論:舊的 AI 測試方法(叫模型畫一張圖)已經測不出高下,2026 年要改用「給預算、給長任務、看它能不能自己撐完兩小時」的長跑測試。
做這件事的人是 Andrej Karpathy。他是 OpenAI 創始成員、前 Tesla AI 負責人,2026 年 5 月起在 Anthropic 做預訓練研究。8 月 2 日他在 X 上貼出這個實驗,兩天內累積約 380 萬次瀏覽、2.6 萬個讚。
但真正值得看的不是那 5,500 行程式碼。是他順口提到的那句「模型看不到自己做出來的東西」。下面拆給你聽。
Karpathy 到底做了什麼實驗?
他給 Claude Opus 5 三樣東西:《魔戒》的第一段文字、100 萬 token 的預算(他自己估算約 10 美元)、一句要求「用 three.js 把它渲染出來」。three.js 是在瀏覽器裡做 3D 的一套函式庫。
然後模型自己跑了大約兩小時,寫出 5,500 行 JavaScript,用程序化的方式把中土世界的開場擺了出來:多邊形資產放進 (x, y, z) 座標、寫動畫、串場景。配音來自 ElevenLabs。8 月 3 日他把原始碼放上網,任何人都能在瀏覽器裡打開來玩、也能 fork 去改。
「我們正在離開那個用『畫一張鵜鶘騎單車的 SVG』來測 LLM 的地帶。」
Andrej Karpathy,2026 年 8 月 2 日
他自己給成果的評價是「有點粗糙但好玩」。這個誠實的形容詞很重要,後面會再提到。
「畫隻鵜鶘踩單車」是什麼測試?為什麼會過期?
這是開發者 Simon Willison 想出來的一個玩法:叫模型畫一張「鵜鶘騎腳踏車」的 SVG 向量圖。選這個題目的理由很聰明——鵜鶘的體型根本騎不了單車,這種組合在訓練資料裡幾乎不存在,模型只能靠自己拼湊。畫得出來就代表它真的懂空間關係,畫不出來就會露餡。
這個思路更早可以追到 2023 年。微軟在 Sparks of AGI 那篇論文裡,讓 GPT-4 用 TikZ 語法畫一隻獨角獸,當作純文字模型也具備空間推理能力的證據。當時的 GPT-4 只吃文字,跟現在人人都是多模態的情況不一樣。
問題是,這類題目現在的模型幾乎都能過。當所有人都考 100 分,這張考卷就沒有鑑別度了。
三代「氛圍測試」怎麼演變的
| 世代 | 年份 | 題目 | 輸出規模 | 真正在測什麼 |
|---|---|---|---|---|
| 第一代 | 2023 | 用 TikZ 畫一隻獨角獸(微軟 Sparks of AGI) | 幾十行 | 純文字模型有沒有空間概念 |
| 第二代 | 2024–2025 | 畫一張鵜鶘騎單車的 SVG(Simon Willison) | 幾十到幾百行 | 訓練資料沒有的組合,會不會硬湊 |
| 第三代 | 2026 | 一段《魔戒》變成 three.js 3D 場景(Karpathy) | 5,500 行 / 2 小時 / 約 $10 | 長時間執行、成本紀律、自我修正 |
這個實驗真正證明了什麼?
三件事,重要性由低到高。
一、工作型態變了:不是一次回答,是一趟長跑
5,000 多行互相配合的 three.js 程式,不可能從一次回答裡掉出來。它需要搭鷹架、反覆擺放資產、接動畫、發現錯了再改,前後兩小時。這是一個「用預算而不是用對話輪數來界定」的任務型態,半年前基本上不存在。
二、經濟學翻轉:以前不會做的事,現在做了也不心痛
Karpathy 的原話大意是:模型有全世界的耐心。所以一件事會從「誰會閒到去做這個」變成「反正幾乎免費,做啊」。把小說裡一個段落做成客製 3D 場景,過去要一組人和一份製作排程;現在的邊際成本大約 10 美元。決策點就從「值不值得做」變成「為什麼不做」。
三、真正的瓶頸:它做得出來,但看不見自己做了什麼
這是整件事最值錢的一段,也是傳播過程中最常被跳過的一段。
模型沒辦法看自己渲染出來的影片。它只能在不同時間點截圖,慢慢看、反覆重試,過程中出錯,於是留下 Karpathy 承認的那些粗糙。他自己的總結是:agent 還沒辦法有效率地、原生地感知影片或在裡面玩遊戲。
它花兩小時蓋了一個互動作品,然後只能透過一根吸管去檢查自己蓋得對不對。
任何要跑長時間 agent 的人都會撞到這面牆。生成能力已經跑在前面,驗證能力還留在原地。
舊測試和新測試差在哪?
差在「一次生成的品質」跟「撐完一段路的能力」是兩種完全不同的東西。
| 維度 | 玩具測試(鵜鶘 SVG) | 長跑測試(魔戒 three.js) |
|---|---|---|
| 耗時 | 幾秒 | 約 2 小時 |
| 成本 | 接近零 | 約 10 美元(100 萬 token) |
| 產出 | 一張圖 | 5,500 行可執行程式 |
| 測到的能力 | 單次生成品質 | 規劃、持續執行、自我修正、成本紀律 |
| 怎麼判好壞 | 肉眼一秒 | 要實際跑起來才知道 |
| 主要弱點 | 模型太強就分不出高下 | 貴、慢、很難標準化成分數 |
開發者社群對這件事的討論分成幾派。多數人認為鵜鶘測試本來就偏娛樂,帶預算的長篇生成是更嚴肅的壓力測試;也有人替便宜的單圖測試講話,說它至少是個幾秒就能跑完的體檢,換成多格漫畫可以同時保有速度和難度。兩邊有共識的一點是:用單一作品評斷模型的時代要結束了。
我的看法:這條推最該被打折的地方在哪?
先講立場,我覺得這個實驗很有價值。但它被轉述的方式跟它本身的內容,落差不小。
第一,Karpathy 自己說了這是 vibe check,不是 benchmark。他用的字是「有點粗糙」。但傳到中文圈的版本,多半只剩「Opus 5 兩小時寫 5,500 行」。一個沒有對照組、沒有重複實驗、沒有評分標準的單次示範,不能拿來當模型排名的依據。你可以說它有趣,不能說它證明了誰比較強。
第二,利益關係要標註出來。Karpathy 從 2026 年 5 月開始在 Anthropic 做預訓練研究,而他測的是 Anthropic 自家的 Claude Opus 5。這不代表結果造假,也不代表他不能測——實驗本身是公開的,原始碼也放出來了,任何人可以自己跑。但看的人心裡要有這條備註。X 上確實有少數人把這條推當成雇主行銷,比較站得住腳的反駁是:早了一步跟講錯了,是兩回事。
第三,也是我認為最實用的一點:這次實驗最值錢的不是它做到的事,是它做不到的那件。10 美元可以生出一個互動 3D 場景,聽起來很爽。但接下來檢查這個場景對不對、哪裡穿模、哪段動畫壞掉,還是要人一格一格看。生成成本降到 10 美元的同時,驗證成本一毛沒降。
對每天在用 AI 幹活的人來說,這句話可以直接換算:你省下來的時間,有多少會在覆核階段被吐回去。這也是為什麼我一直覺得,把輸出限制在一個「有標準答案可以驗」的形式裡(表格、程式碼、能跑的檔案),比讓 AI 自由發揮有用得多。這點在 Karpathy 講 agentic engineering 的那場演講拆解裡也講過類似的邏輯。
你現在該怎麼重新測你在用的 AI?
不用真的去渲染中土世界。把長跑測試的精神抓出來就好,五個步驟。
- 選一個你真的會做的任務,不要選腦筋急轉彎。你每週都要做的那件雜事最好(整理報表、寫週報、清資料、做投影片)。
- 把它包成一趟長跑:一次給完所有背景、規則、格式要求,然後放手讓它跑完,中間不要一直插嘴。
- 先訂預算再開始。決定這次最多花多少(時間或錢),跑完就停。預算是紀律,不是限制。
- 把驗證方式先寫好。開跑前就決定「怎樣算做完」——能不能跑、數字對不對、格式合不合。這一步最多人跳過,然後在最後花三倍時間收尾。
- 失敗的地方才是資訊。分清楚它是「能力不夠」還是「預算不夠」。前者要換工具,後者只要加錢。
長跑測試題產生器 + 成本試算
選你的場景,產生一段可以直接貼去用的長跑測試指令,順便估一下這趟要花多少。
成本只是粗估。實際費用看你用哪個模型、輸入輸出比例、有沒有快取,可能差好幾倍。跑之前先在你的帳單頁確認單價。
除了叫它渲染 3D,還有什麼長跑測試法?
不是每個人都要看中土世界。同樣的精神可以換成這幾種,難度和成本都低很多。
- 多格漫畫版鵜鶘:不要一張圖,要一則六格短篇,前後角色和場景要一致。保留了幾秒就能看完的優點,但同時考連貫性。
- 可執行小工具:叫它做一個單檔 HTML 小工具。好處是驗收標準很硬——打得開、點得動、Console 沒錯就是過。
- 資料清理長跑:丟一份髒資料,要求輸出乾淨表格加上每一步的修改紀錄。這個最貼近上班族的日常。
- 逐步交付檢查點:把一個大任務切成幾個檢查點,看它在第 5 個檢查點還能不能記得第 1 個訂下的規則。長跑會不會走鐘,這裡看得最清楚。
共通點是:輸出要能被機器或規則驗證,不要只能靠感覺。感覺這種東西,模型比你更會迎合。
接下來該關注什麼?
三個訊號,看到了就代表這條線又往前走了一格。
- 模型能不能看自己的輸出。目前要靠截圖,未來如果能原生讀影片、能在自己做的東西裡面操作,長跑任務的品質會直接跳一階。這是現在最明確的缺口。
- 有沒有人把長跑做成可比較的標準。現在的長跑測試各玩各的,沒辦法排名。誰先做出一套「同題目、同預算、可重跑」的評測,誰就接手了鵜鶘的位置。
- token 預算會不會變成標準的計價單位。如果之後大家講一個任務都用「這是一趟 50 萬 token 的活」來描述,那整個外包和報價方式都會跟著改。
常見問題
鵜鶘測試現在完全沒用了嗎?
沒有完全沒用,但鑑別度大幅下降。前段班的模型現在都畫得出來,你用它分不出誰比較好。當成三秒鐘的體檢還行,當成評比依據不行。
我要花 10 美元才能測 AI 嗎?
不用。Karpathy 那趟之所以貴,是因為他要的東西本身就大。用 20 萬 token 跑一個你日常真的會做的任務,成本大概是他的五分之一,得到的資訊對你更有用,因為那是你自己的工作。
這代表 Claude Opus 5 比其他模型強嗎?
這個實驗證不了這件事。它是單次示範,沒有對照組,Karpathy 自己也說是 vibe check。而且他目前任職於 Anthropic,測的是自家模型。要比較模型強弱,還是得看能重複、有對照的評測。
普通上班族能從這件事拿走什麼?
一個習慣的改變:不要再把 AI 當成問一句答一句的搜尋框,改成派一趟有預算、有驗收標準的活給它。同樣的工具,用法換了,產出差距會非常大。
結論
玩具測試退場,是因為模型長大了。這件事本身沒什麼好吵的。
比較值得記住的是那個不對稱:一趟兩小時的長跑生成只要 10 美元,但檢查它做得對不對,還是得靠人一格一格看。生成便宜了,驗證沒有。誰先把驗證這一段自動化,誰才真的拿到這波的紅利。
在那之前,你能做的最實際的事,是把上面那個測試題產生器跑一次,換一個你每週都要做的任務進去。你會很快知道,你現在用的那個 AI,到底是撐得完兩小時,還是只撐得完兩句話。
延伸閱讀:AI 花 $2,000 解決 10 條數學懸案,但沒人告訴你它「沒有」證明什麼、claude-howto:9,700 星的 Claude Code 教學地圖。
資料時效:本文內容截至 2026 年 8 月 4 日。AI 模型與定價變動極快,文中的 token 價格為原作者自行估算,實際費用請以你的服務商帳單為準。本文為資訊整理與個人觀點分享,不構成任何投資或採購建議。文中提及的實驗由 Andrej Karpathy 於 2026 年 8 月 2 日公開發表,他自 2026 年 5 月起任職於 Anthropic。





發表迴響