一個 744B(7,440 億參數)的大模型,過去要一整櫃 GPU 才餵得動。現在有人用一個 C 檔案、零依賴,讓它在一部 25GB RAM 的普通電腦上跑起來——這個叫 colibrì 的開源引擎,幾天內就衝到 1.6 萬顆星。
一句話結論:colibrì 是一個純 C、零依賴的推理引擎,靠「把 MoE 專家從硬碟串流」,讓 744B 的 GLM-5.2 在 25GB RAM 的普通機器上「跑得起來」;但真正堪用的速度要更多記憶體或 GPU,25GB 只是「能跑」的地板。
截至 2026 年 7 月,這個項目(GitHub:JustVugg/colibri)已經累積約 16,900 顆星、1,600 個 fork,v1.0.0 在 7 月 19 日發布。它做的事情聽起來違反常識:用比模型本身小得多的記憶體,跑一個比多數前沿模型還大的模型。下面拆解它到底怎麼辦到、實際有多快、你該不該碰。
colibrì 到底是什麼?
它是一個把大型 MoE(混合專家)模型跑在消費級硬體上的推理引擎,作者是義大利開發者 Vincenzo Fornaro。整個運行核心就是一個 C 檔案(c/glm.c)加幾個小標頭檔——沒有 BLAS、執行期沒有 Python、也不強制要 GPU。授權是 Apache-2.0,搭配的 GLM-5.2 權重由智譜(Z.ai)以 MIT 釋出。
名字來自蜂鳥(colibrì):一隻幾克重的小鳥,卻能懸停、一天拜訪上千朵花。作者的比喻是,這個引擎就是用「蜂鳥的口糧」——25GB RAM、十二個 CPU 核心,加上一點硬碟的耐性——養活一頭 7,440 億參數的巨獸。這個定位很清楚:不是要跟雲端 API 拼速度,而是證明「超大模型也能落到你自己的機器上」。
744B 的模型,為什麼塞得進 25GB RAM?
關鍵在於 MoE 的稀疏性。一個 744B 的混合專家模型,每生成一個 token 其實只用到大約 40B 參數,而其中會隨 token 改變的(被路由選中的專家)只有約 11GB。換句話說,模型不需要整個「塞進」快記憶體,它需要的是被「擺對位置」。
colibrì 的做法是把模型拆成兩層放:
- 密集部分(注意力、共享專家、embedding,約 17B 參數)以 int4 常駐在 RAM,大約佔 9.9GB。
- 19,456 個被路由的專家(75 個 MoE 層 × 256 個,加上 MTP 頭,每個 int4 下約 19MB)放在硬碟上(約 370GB),需要時才串流進來,配一個每層的 LRU 快取跟「常用專家釘住」的熱區。
這個設計有一個很聰明的原則:擺放位置只決定速度,不改變結果。同一個專家,無論是從 VRAM、RAM 還是硬碟拿出來算,路由決定和權重精度都一模一樣。所以它不會為了塞進小記憶體而偷偷降精度——這點作者在文件裡講得很白,也是它跟一些「硬壓量化」方案的分別。
它靠什麼把速度撐住?
硬碟很慢,所以引擎大部分的巧思都花在「盡量不等硬碟、等的時候順便算別的」。幾個重點:
- 一次讀完、非同步預載:每個專家的三個矩陣存在一起,一次
pread讀完;一個非同步 I/O 池在載入缺失專家的同時,讓已在記憶體的專家繼續運算。 - 路由預測:一條「領航」執行緒會提前預取下一層要用的專家——實測顯示,路由在「提前一層」的情況下有 71.6% 可以預測,命中就省掉一次等硬碟。
- 會學習的快取:引擎會記錄「你的用途」常路由到哪些專家(存進
.coli_usage),自動把最熱的釘住。用得越久,它跑得越快。 - KV 狀態壓縮:MLA 注意力把每個 token 的 KV 從 32,768 個浮點數壓到 576 個(小 57 倍),還能跨重啟保存,對話重開是「溫的」,不用重新 prefill。
- 投機解碼:用 GLM-5.2 原生的 MTP 頭先草擬 token、主模型一次批次驗證,划算時能到 2.2–2.8 token/次前向。
它還附一個網頁儀表板(./coli web),能看即時 token 速度、VRAM/RAM/硬碟的分層佔用,甚至一個「Brain」頁面把 19,456 個專家畫成一片會發光的大腦皮層——哪個專家被路由到就閃白光。這部分比較像展示,但確實把「MoE 內部在幹嘛」視覺化得很直觀。
實測速度到底有多快?(別被 25GB 這數字騙了)
這是最需要講清楚的一段。「25GB RAM 跑 744B」是真的,但那是「能正確跑」的地板,不是「好用」的速度。作者自己公布的實測數據很誠實:
| 硬體 | 解碼速度 | 備註 |
|---|---|---|
| 6× RTX 5090(專家全常駐) | 5.8–6.8 token/秒 | 首字約 13 秒,硬碟退出解碼路徑 |
| 128GB CPU-only 桌機 | 約 1.8 token/秒(暖機後) | 不用 GPU,靠大 RAM |
| 單張 RTX 5070 Ti(筆電級) | 1.07 token/秒 | 走 GPU 常駐管線 |
| 25GB 開發機 | 0.05–0.1 token/秒(冷) | 項目最初的起點,也是最誠實的地板 |
看清楚最後一行:25GB 那台每秒 0.05 到 0.1 個 token,等於一個字要等十幾秒。它證明的是「這麼大的模型真的能在小機器上正確算出來」,而不是「你可以拿舊筆電當 ChatGPT 用」。想要堪用的互動速度,你需要一台大 RAM 的桌機,或者乾脆上多張 GPU。把記憶體換成速度——這正是 colibrì 的核心取捨。
另一個加分點是它對「忠實度」的堅持:前向運算跟 transformers 的參考實作做過逐 token 對齊驗證,量化的品質代價也有另外的實測表,不是嘴上說說。
怎麼上手?
流程不算複雜,但要先有硬碟空間放模型。基本三步:
- 拿模型:Hugging Face 上有預轉好的 GLM-5.2 int4 版本,記得挑「int8 MTP 頭」那個(int4 的草擬頭接受率會掉到近乎 0)。
- 編譯:進
c資料夾跑./setup.sh,它會檢查 gcc/OpenMP、編譯並自測。Windows 用戶更省事,Releases 直接下載 zip,解壓改名就能用,不必自己編。 - 開跑:
./coli chat進對話;./coli web同時開 API 加網頁儀表板;./coli serve只開 OpenAI 相容的 API;./coli doctor先做一次唯讀的就緒檢查。
執行期是純 C,Python 只在「一次性轉檔」跟「選用的 API 閘道」會用到。它提供 OpenAI 相容 API 這點很實際——代表你現有接 ChatGPT/Claude 的程式,理論上把 endpoint 一換就能指到本地這台。
colibrì 跟 Ollama、llama.cpp 差在哪?
差在「它專門解一個別人不太碰的問題」:用少於模型大小的記憶體,跑超大的 MoE。Ollama 勝在好上手、模型庫齊;llama.cpp 是老牌的量化推理底層;colibrì 則把賭注全押在「硬碟串流專家」這條路上。
| 面向 | colibrì | Ollama | llama.cpp |
|---|---|---|---|
| 定位 | 單檔 C 引擎,硬碟串流專家 | 本地模型一鍵跑 | C/C++ 推理底層 |
| 主打 | 用小記憶體跑超大 MoE | 易用、模型多 | 量化+跨平台老牌 |
| 執行期依賴 | 零(純 C) | 打包 llama.cpp | 需自行編譯/綁定 |
| 拿手模型 | 超大 MoE(如 744B) | 中小模型為主 | 中小~大模型 |
| 25GB RAM 跑 744B | 可以(很慢) | 基本不行 | 通常不行 |
| 授權 | Apache-2.0 | MIT | MIT |
如果你只是想在本機跑個中小模型聊天,Ollama 還是最省事的選擇。colibrì 的價值在於「我就是想在自己機器上碰那個 744B 的大傢伙」這種需求。
誰適合玩、誰不用碰?
適合:想在本地跑超大模型的研究者與愛好者、資料不能出門的團隊(本地跑=不上傳雲端)、以及純粹想搞懂 MoE 如何在硬體上落地的人。它把一個很硬的系統問題,寫成一份讀得懂的開源程式碼。
不適合:只想「開箱即用、越快越好」的一般用戶。25GB 機器上的速度沒有實用性,要堪用得投資大 RAM 桌機或多張 GPU;到那個成本,很多人其實直接用雲端 API 更划算。對想省錢做 AI 副業的人,本地模型的意義在「離線、隱私、長期不付月費」,而不是「馬上比雲端便宜」——先算清楚電費、硬體攤提,再決定值不值。想在雲端這頭把 token 帳單壓下來,可以參考我們寫過的 pxpipe 把 Claude Code token 砍 7 成 那篇。
替代方案有哪些?
如果 colibrì 的門檻對你太高:想輕鬆在本地跑模型,用 Ollama 或 LM Studio;想要底層可控的量化推理,用 llama.cpp;如果本地根本划不來、只是想省雲端成本,那方向應該是「用更聰明的方式接雲端 API」而不是硬扛本地。想看另一個「單一 binary、零安裝負擔」的開源代表,可以順帶看我們介紹過的 OfficeCLI(讓 AI 讀寫 Word/Excel/PPT 的單檔工具)。
常見問題
colibrì 一定要有 GPU 嗎?不用。它執行期是純 C、不強制 GPU,CPU-only 也能跑;GPU 只是讓專家常駐、加速。
25GB RAM 真的能跑 744B?能,但每秒只有約 0.05–0.1 個 token,屬於「證明可行」的等級,不是日常互動的速度。
它會不會為了塞進小記憶體而降品質?預設不會。它的設計原則是「擺放只影響速度、不改精度與路由」,前向運算也做過逐 token 對齊驗證。
可以接我現有的程式嗎?可以。它提供 OpenAI 相容 API(./coli serve),把 endpoint 指到本地這台即可。
結論:一個把「不可能」變成「很慢但可行」的項目
colibrì 最值得看的,不是「25GB 跑 744B」這個標題數字,而是它背後那個判斷:超大模型的瓶頸未必是「你買不起足夠的記憶體」,而是「你有沒有把記憶體、硬碟當成同一套階層來管」。它用一個人、一個 C 檔案,把這個想法做成了能跑、能驗證、能讀懂的開源程式碼。
對一般人來說,它現在還不是「換掉雲端 AI」的答案。但它指出了一個方向:本地跑大模型的門檻,正在被一行一行 C 程式碼往下拉。想追這條線的人,這個項目值得收藏。
本文為技術科普與工具介紹,資料截至 2026 年 7 月,星數、版本與實測數據以項目 GitHub 頁面為準,可能隨時間變動。文中不構成任何投資或購買建議。自行編譯、下載模型與運行請注意硬體與授權條款。






發表迴響