一個 744B(7,440 億參數)的大模型,過去要一整櫃 GPU 才餵得動。現在有人用一個 C 檔案、零依賴,讓它在一部 25GB RAM 的普通電腦上跑起來——這個叫 colibrì 的開源引擎,幾天內就衝到 1.6 萬顆星。

一句話結論:colibrì 是一個純 C、零依賴的推理引擎,靠「把 MoE 專家從硬碟串流」,讓 744B 的 GLM-5.2 在 25GB RAM 的普通機器上「跑得起來」;但真正堪用的速度要更多記憶體或 GPU,25GB 只是「能跑」的地板。

截至 2026 年 7 月,這個項目(GitHub:JustVugg/colibri)已經累積約 16,900 顆星、1,600 個 fork,v1.0.0 在 7 月 19 日發布。它做的事情聽起來違反常識:用比模型本身小得多的記憶體,跑一個比多數前沿模型還大的模型。下面拆解它到底怎麼辦到、實際有多快、你該不該碰。

colibrì 到底是什麼?

它是一個把大型 MoE(混合專家)模型跑在消費級硬體上的推理引擎,作者是義大利開發者 Vincenzo Fornaro。整個運行核心就是一個 C 檔案(c/glm.c)加幾個小標頭檔——沒有 BLAS、執行期沒有 Python、也不強制要 GPU。授權是 Apache-2.0,搭配的 GLM-5.2 權重由智譜(Z.ai)以 MIT 釋出。

名字來自蜂鳥(colibrì):一隻幾克重的小鳥,卻能懸停、一天拜訪上千朵花。作者的比喻是,這個引擎就是用「蜂鳥的口糧」——25GB RAM、十二個 CPU 核心,加上一點硬碟的耐性——養活一頭 7,440 億參數的巨獸。這個定位很清楚:不是要跟雲端 API 拼速度,而是證明「超大模型也能落到你自己的機器上」。

744B 的模型,為什麼塞得進 25GB RAM?

關鍵在於 MoE 的稀疏性。一個 744B 的混合專家模型,每生成一個 token 其實只用到大約 40B 參數,而其中會隨 token 改變的(被路由選中的專家)只有約 11GB。換句話說,模型不需要整個「塞進」快記憶體,它需要的是被「擺對位置」。

colibrì 的做法是把模型拆成兩層放:

  • 密集部分(注意力、共享專家、embedding,約 17B 參數)以 int4 常駐在 RAM,大約佔 9.9GB。
  • 19,456 個被路由的專家(75 個 MoE 層 × 256 個,加上 MTP 頭,每個 int4 下約 19MB)放在硬碟上(約 370GB),需要時才串流進來,配一個每層的 LRU 快取跟「常用專家釘住」的熱區。

這個設計有一個很聰明的原則:擺放位置只決定速度,不改變結果。同一個專家,無論是從 VRAM、RAM 還是硬碟拿出來算,路由決定和權重精度都一模一樣。所以它不會為了塞進小記憶體而偷偷降精度——這點作者在文件裡講得很白,也是它跟一些「硬壓量化」方案的分別。

它靠什麼把速度撐住?

硬碟很慢,所以引擎大部分的巧思都花在「盡量不等硬碟、等的時候順便算別的」。幾個重點:

  • 一次讀完、非同步預載:每個專家的三個矩陣存在一起,一次 pread 讀完;一個非同步 I/O 池在載入缺失專家的同時,讓已在記憶體的專家繼續運算。
  • 路由預測:一條「領航」執行緒會提前預取下一層要用的專家——實測顯示,路由在「提前一層」的情況下有 71.6% 可以預測,命中就省掉一次等硬碟。
  • 會學習的快取:引擎會記錄「你的用途」常路由到哪些專家(存進 .coli_usage),自動把最熱的釘住。用得越久,它跑得越快。
  • KV 狀態壓縮:MLA 注意力把每個 token 的 KV 從 32,768 個浮點數壓到 576 個(小 57 倍),還能跨重啟保存,對話重開是「溫的」,不用重新 prefill。
  • 投機解碼:用 GLM-5.2 原生的 MTP 頭先草擬 token、主模型一次批次驗證,划算時能到 2.2–2.8 token/次前向。

它還附一個網頁儀表板(./coli web),能看即時 token 速度、VRAM/RAM/硬碟的分層佔用,甚至一個「Brain」頁面把 19,456 個專家畫成一片會發光的大腦皮層——哪個專家被路由到就閃白光。這部分比較像展示,但確實把「MoE 內部在幹嘛」視覺化得很直觀。

實測速度到底有多快?(別被 25GB 這數字騙了)

這是最需要講清楚的一段。「25GB RAM 跑 744B」是真的,但那是「能正確跑」的地板,不是「好用」的速度。作者自己公布的實測數據很誠實:

硬體解碼速度備註
6× RTX 5090(專家全常駐)5.8–6.8 token/秒首字約 13 秒,硬碟退出解碼路徑
128GB CPU-only 桌機約 1.8 token/秒(暖機後)不用 GPU,靠大 RAM
單張 RTX 5070 Ti(筆電級)1.07 token/秒走 GPU 常駐管線
25GB 開發機0.05–0.1 token/秒(冷)項目最初的起點,也是最誠實的地板

看清楚最後一行:25GB 那台每秒 0.05 到 0.1 個 token,等於一個字要等十幾秒。它證明的是「這麼大的模型真的能在小機器上正確算出來」,而不是「你可以拿舊筆電當 ChatGPT 用」。想要堪用的互動速度,你需要一台大 RAM 的桌機,或者乾脆上多張 GPU。把記憶體換成速度——這正是 colibrì 的核心取捨。

另一個加分點是它對「忠實度」的堅持:前向運算跟 transformers 的參考實作做過逐 token 對齊驗證,量化的品質代價也有另外的實測表,不是嘴上說說。

怎麼上手?

流程不算複雜,但要先有硬碟空間放模型。基本三步:

  1. 拿模型:Hugging Face 上有預轉好的 GLM-5.2 int4 版本,記得挑「int8 MTP 頭」那個(int4 的草擬頭接受率會掉到近乎 0)。
  2. 編譯:進 c 資料夾跑 ./setup.sh,它會檢查 gcc/OpenMP、編譯並自測。Windows 用戶更省事,Releases 直接下載 zip,解壓改名就能用,不必自己編。
  3. 開跑./coli chat 進對話;./coli web 同時開 API 加網頁儀表板;./coli serve 只開 OpenAI 相容的 API;./coli doctor 先做一次唯讀的就緒檢查。

執行期是純 C,Python 只在「一次性轉檔」跟「選用的 API 閘道」會用到。它提供 OpenAI 相容 API 這點很實際——代表你現有接 ChatGPT/Claude 的程式,理論上把 endpoint 一換就能指到本地這台。

colibrì 跟 Ollama、llama.cpp 差在哪?

差在「它專門解一個別人不太碰的問題」:用少於模型大小的記憶體,跑超大的 MoE。Ollama 勝在好上手、模型庫齊;llama.cpp 是老牌的量化推理底層;colibrì 則把賭注全押在「硬碟串流專家」這條路上。

面向colibrìOllamallama.cpp
定位單檔 C 引擎,硬碟串流專家本地模型一鍵跑C/C++ 推理底層
主打用小記憶體跑超大 MoE易用、模型多量化+跨平台老牌
執行期依賴零(純 C)打包 llama.cpp需自行編譯/綁定
拿手模型超大 MoE(如 744B)中小模型為主中小~大模型
25GB RAM 跑 744B可以(很慢)基本不行通常不行
授權Apache-2.0MITMIT

如果你只是想在本機跑個中小模型聊天,Ollama 還是最省事的選擇。colibrì 的價值在於「我就是想在自己機器上碰那個 744B 的大傢伙」這種需求。

誰適合玩、誰不用碰?

適合:想在本地跑超大模型的研究者與愛好者、資料不能出門的團隊(本地跑=不上傳雲端)、以及純粹想搞懂 MoE 如何在硬體上落地的人。它把一個很硬的系統問題,寫成一份讀得懂的開源程式碼。

不適合:只想「開箱即用、越快越好」的一般用戶。25GB 機器上的速度沒有實用性,要堪用得投資大 RAM 桌機或多張 GPU;到那個成本,很多人其實直接用雲端 API 更划算。對想省錢做 AI 副業的人,本地模型的意義在「離線、隱私、長期不付月費」,而不是「馬上比雲端便宜」——先算清楚電費、硬體攤提,再決定值不值。想在雲端這頭把 token 帳單壓下來,可以參考我們寫過的 pxpipe 把 Claude Code token 砍 7 成 那篇。

替代方案有哪些?

如果 colibrì 的門檻對你太高:想輕鬆在本地跑模型,用 OllamaLM Studio;想要底層可控的量化推理,用 llama.cpp;如果本地根本划不來、只是想省雲端成本,那方向應該是「用更聰明的方式接雲端 API」而不是硬扛本地。想看另一個「單一 binary、零安裝負擔」的開源代表,可以順帶看我們介紹過的 OfficeCLI(讓 AI 讀寫 Word/Excel/PPT 的單檔工具)

常見問題

colibrì 一定要有 GPU 嗎?不用。它執行期是純 C、不強制 GPU,CPU-only 也能跑;GPU 只是讓專家常駐、加速。

25GB RAM 真的能跑 744B?能,但每秒只有約 0.05–0.1 個 token,屬於「證明可行」的等級,不是日常互動的速度。

它會不會為了塞進小記憶體而降品質?預設不會。它的設計原則是「擺放只影響速度、不改精度與路由」,前向運算也做過逐 token 對齊驗證。

可以接我現有的程式嗎?可以。它提供 OpenAI 相容 API(./coli serve),把 endpoint 指到本地這台即可。

結論:一個把「不可能」變成「很慢但可行」的項目

colibrì 最值得看的,不是「25GB 跑 744B」這個標題數字,而是它背後那個判斷:超大模型的瓶頸未必是「你買不起足夠的記憶體」,而是「你有沒有把記憶體、硬碟當成同一套階層來管」。它用一個人、一個 C 檔案,把這個想法做成了能跑、能驗證、能讀懂的開源程式碼。

對一般人來說,它現在還不是「換掉雲端 AI」的答案。但它指出了一個方向:本地跑大模型的門檻,正在被一行一行 C 程式碼往下拉。想追這條線的人,這個項目值得收藏。

本文為技術科普與工具介紹,資料截至 2026 年 7 月,星數、版本與實測數據以項目 GitHub 頁面為準,可能隨時間變動。文中不構成任何投資或購買建議。自行編譯、下載模型與運行請注意硬體與授權條款。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

عن Mr. Slash

«Mr. Slash» منصة محتوى مالي تأسست عام 2024، يديرها فريق تحرير متخصص. نقدّم للقارئ العربي شروحات عملية ومحايدة عن العملات الرقمية وطرق الشراء والإيداع والسحب المحلية في السعودية ومصر والخليج.

هدفنا مساعدتك على فهم السوق واختيار منصة تداول موثوقة وتقليل الرسوم. نحن لا نقدّم نصيحة استثمارية والقرار النهائي يبقى لك؛ وفي حال التعاون التجاري يُوضَّح ذلك صراحةً ولا يمثّل رأي الموقع.

تواصل وتعاون تجاري

لأي استفسار أو اقتراح أو تعاون، تواصل معنا عبر إنستغرام @slash.Capital. شكرًا لك!

發表迴響

相關文章

مقالات ذات صلة

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash