一個只有 30 億參數的模型,在 2026 年的奧數題庫 AIME 上拿到 94.3 分。同一份考卷,Google 那台跑在資料中心、參數幾百倍大的 Gemini 3 Pro,只拿到 91.7。

更離譜的是,這個模型來自微博。對,就是你刷熱搜那個微博。它叫 VibeThinker-3B,週末悄悄丟上 Hugging Face,配 MIT 授權,任何人都能下載、商用、改造。整個 AI 圈為了它的跑分吵了一整週。

一句話結論:VibeThinker-3B 是微博開源的 3B 小推理模型,在 AIME 2026 奧數測試上超過 Gemini 3 Pro、打平 DeepSeek V3.2,證明「強推理」不再是大廠 GPU 軍團的專利,小到能塞進你電腦。

VibeThinker-3B 到底是什麼?

它是一個密集型(dense,所有參數每次都會用上,不是那種「只啟動一部分」的 MoE)語言模型,參數量 30 億,基礎建在阿里的 Qwen2.5-Coder-3B 上面。重點不在它會聊天,而在它會「推理」:解數學、寫程式、做 STEM 邏輯題。

講人話:3B 這個尺寸,意思是它可以塞進一張普通顯卡、甚至高階手機就能跑,不用租雲端、不用排隊搶 GPU。而它在奧數級別的題目上,跟那些動輒 6,000 億、7,000 億參數、只能養在資料中心的旗艦模型打成平手。

微博的團隊把方法論寫進論文,標題就很挑釁:Tiny Model, Big Logic(小模型,大邏輯)。訓練手法疊了三層:先做課程式微調(由淺到深餵題目),再上多領域強化學習,最後做離線自蒸餾。沒有什麼祕密武器,就是把已知的方法調到極致。

94.3 分有多誇張?跟旗艦模型比一下

差距大到一句話講不完,直接看表。AIME 是美國高中數學邀請賽,題目難度接近奧數初選,是業界公認最能測「真推理」的考卷之一。

模型參數量AIME 2026 分數開源 / 授權
VibeThinker-3B30 億94.3(測試時策略可到 97.1)✅ MIT,可商用
DeepSeek V3.26,710 億約 94 級✅ 開源
GLM-57,440 億同檔次✅ 開源
Gemini 3 Pro未公開(極大)91.7❌ 閉源

看懂這張表的關鍵不是「誰第一」,而是左邊那欄。VibeThinker 用 DeepSeek V3.2 不到百分之一的參數量,做到差不多的成績。這不是「便宜了一點」,是差了兩個數量級。

不只奧數。它在其他考卷上也站得住:AIME 2025 拿 91.4、HMMT 2025 拿 89.3、IMO-AnswerBench 拿 76.4;寫程式那邊,LiveCodeBench v6 的 Pass@1 是 80.2,而且在四到五月那批它沒看過的 LeetCode 週賽題上,通過率 96.1%。一個 3B 模型有這種數字,放在一年前是不可想像的。

為什麼整個 AI 圈在吵?

因為跑分這種事,向來容易作弊。最常見的質疑是「資料污染」:如果模型訓練時不小心吃進了考題答案,分數自然漂亮。一個 3B 模型衝到旗艦水準,第一反應當然是懷疑它是不是「背過考卷」。

微博的反駁是那組 LeetCode 數據:那批週賽題是四月底到五月底才開放、模型訓練完成之後才出現的「全新題」,理論上不可能被污染,而它照樣拿 96.1%。這條證據沒辦法完全平息爭論,但夠分量讓人認真看待。

真正讓人坐立難安的不是分數,是參數量。它逼著大廠回答一個問題:如果 3B 就能做到,那你那 7,000 億參數,到底有多少是真的需要的?

這就是它的政治意義。過去兩年的主流敘事是「模型越大越強,所以算力就是國力」。VibeThinker 不是推翻這句話,但它在「推理」這個最硬的能力上戳了一個洞:在某些任務上,把方法做對,比把參數堆大更有效。

對普通人和散戶,這件事意味著什麼?

意味著「強推理」開始下放。以前你要一個會解難題、會寫程式的 AI,要嘛付 ChatGPT Plus、Claude Pro 的月費,要嘛租雲端 GPU。現在有一條新路:一個免費、可商用、跑得動在自己機器上的小模型,數學和程式能力直接對標第一梯隊。

具體的影響有三個方向。第一,做產品的人成本驟降——以前要靠 API 按量付費的推理任務,現在可以本地跑,邊際成本趨近於零。第二,注重隱私的場景(醫療、法務、財務)有了不上雲也能用的選項。第三,這對閉源模型的定價是一種壓力,當開源的免費方案能打平你的付費旗艦,你的訂閱費就不好收了。

當然要說清楚邊界:VibeThinker 是「推理專精」模型,它強在數學、程式、邏輯。它不是全能型選手,日常閒聊、寫文案、長文理解這些,旗艦大模型還是更圓融。它是一把鋒利的專用刀,不是瑞士軍刀。

想自己玩,現在能怎麼動手?

門檻比你想的低。給有點基礎、想實際跑跑看的人一份最小行動清單:

  1. 到 Hugging Face 搜 WeiboAI/VibeThinker-3B,模型權重和說明都在那裡,MIT 授權直接下載。
  2. GitHub 找 WeiboAI/VibeThinker,訓練程式碼和工具是開放的,想復現或微調都看得到方法。
  3. 本地跑可以用 Ollama 或 LM Studio 這類工具掛起來,3B 尺寸對 16GB 記憶體的機器很友善。
  4. 真要它發揮,記得它是推理模型,丟數學題、程式題、邏輯題給它,別當聊天機器人用。

如果你不想折騰本地部署,也有替代路線:DeepSeek 的網頁版同樣免費、推理能力強;只要會解難題不在意尺寸,Qwen 系列的開源模型也值得一試。VibeThinker 的價值在「小」,如果你不缺算力,大模型體驗還是更省事。

常見問題

VibeThinker-3B 真的免費嗎?
是。模型權重和訓練程式碼都採 MIT 授權放在 Hugging Face 和 GitHub,個人和商用都免費,不用付費訂閱。

它能取代 ChatGPT 或 Claude 嗎?
在數學和程式推理上可以打平甚至超過,但日常對話、寫作、長文理解這些綜合能力,旗艦大模型還是更強。它是專用工具,不是全能替代。

普通電腦跑得動嗎?
跑得動。3B 參數量很輕,一張普通顯卡或 16GB 記憶體的機器就能本地運行,這正是它最大的賣點。

結論:算力不是唯一的答案

VibeThinker-3B 不會讓旗艦模型退場,大模型在綜合能力上的優勢還很實在。但它提供了一個過去被忽略的證據:在推理這條路上,方法的價值被嚴重低估了。一家做社群的公司,用一個塞得進手機的模型,在奧數考卷上贏了 Google 的旗艦,這件事本身就值得記住。

對你我來說,最實際的一句話是:強推理正在變便宜、變開放、變得人人可得。接下來該盯的,是還有多少「只有大廠才做得到」的能力,會被下一個 3B 模型打破。

本文資訊截至 2026 年 6 月,模型版本與跑分數據可能隨更新變動。文中提及的工具與授權條款請以官方頁面為準。本文為資訊分享,不構成任何投資或採購建議。

延伸閱讀:站內相關文章

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash