一個指令,告訴你手上這台電腦跑得動哪些開源大模型。llmfit 今天 35,962 顆星,模型庫裡躺著 12,937 筆資料。
一句話結論:llmfit 值得裝,12,937 個模型是真的,但速度欄只有打了 ✓ 的那幾行是真的量過,全專案跑得最勤的那台電腦也只量到 137 個,佔可排名模型的 1.41%。
這篇不是唱衰。llmfit 的工程水準在同類工具裡算前段班,它甚至主動幫你標出哪些數字不可信。問題是多數人裝完就直接看排行榜第一行,而那一行的速度八成是算出來的。
以下數字都是我把倉庫拉下來重算的,沒有抄 README,時間點是 2026 年 9 月 11 日。
llmfit 是什麼?為什麼突然三萬多顆星
它是一個用 Rust 寫的終端機工具。跑起來之後它會偵測你的 CPU、記憶體、顯示卡、VRAM,然後把一整份開源模型清單按「你這台機器跑不跑得動」排序,同時估一個每秒幾個 token 的速度。
會紅是有道理的。想在自己電腦跑模型,最卡的從來不是安裝,是「我這張 16GB 的卡配得上哪隻」。以前要自己查參數量、查量化格式、心算 KV cache,llmfit 把這段全包了。
| 項目 | 實查數值(2026-09-11) |
|---|---|
| Stars | 35,962(當日 +258) |
| Forks / Watchers | 2,273 / 114 |
| 建立 / 最後推送 | 2026-02-15 / 2026-09-11 |
| 語言 / 授權 | Rust / MIT |
| commit 數 / 貢獻者 | 1,176 / 124 |
| Rust 程式碼行數 | 56,467 行 |
測試區塊 #[test] | 826 個 |
| 最新版本 | v1.1.15(2026-09-10) |
826 個測試區塊配 56,467 行程式碼,這個比例在 GitHub 日榜上很少見。先把這句放前面,後面講的所有問題都不改變這個評價。
它的模型庫真的有「數百個」嗎?
不只,而且多很多。README 的功能列表寫著「Hundreds of models & providers」,我把它內建的資料檔 llmfit-core/data/hf_models.json(11.2 MB)打開數,是 12,937 個模型、3,957 個供應商。
這是少報,不是灌水。願意把 12,937 寫成「數百」的專案不多,多數人會反過來做。這點要記在它帳上。
但把資料翻到第二層,事情就沒那麼漂亮了。
為什麼 43.5% 的模型從來沒人下載過?
因為這份清單是機器爬回來的。每一筆資料都有一個 _discovered 欄位,數下去:12,748 筆是自動抓的,佔 98.5%,人工挑過的只有 189 筆。倉庫裡確實躺著一支 134 KB 的爬蟲腳本 scripts/scrape_hf_models.py。
爬回來的東西長這樣:
| 指標 | 筆數 | 佔 12,937 |
|---|---|---|
| 下載數為 0 | 5,633 | 43.5% |
| 按讚數為 0 | 11,058 | 85.5% |
| 下載數與按讚數同時為 0 | 5,606 | 43.3% |
| 參數量不到 100 萬 | 57 | 0.4% |
清單第一筆叫 Fu01978/Nano-H,參數量欄位寫著 2。不是 2B,不是 2M,是兩個參數。下載 0、按讚 0。
這不是說作者造假。從 Hugging Face 全站爬模型,本來就會撈到一堆別人的實驗性上傳。真正要問的是下一題。
這些垃圾資料會不會被推薦到我面前?
部分會。llmfit 有一層過濾,但那層過濾管的是「數字合不合理」,不是「有沒有人用過」。
我在 llmfit-core/src/models.rs 找到一個叫 SanitizationReason 的列舉,只有三條規則,註解寫明是為了處理 issue #969:
- SpecDecodeDraft:名字帶 EAGLE、DFlash、DSpark 這類推測解碼草稿模型,不是完整模型。
- SizeNameDivergence:名字說 7B、資料說 0.5B,兩邊差 4 倍以上。
- ImplausibleFootprint:宣稱的最低記憶體換算成「每個參數幾個 bit」,掉出 1 到 33 的合理區間。
我照著原始碼裡的正規表示式和門檻,用 Python 重跑了一次全部 12,937 筆:
| 判定 | 筆數 | 佔比 |
|---|---|---|
| ImplausibleFootprint 被降級 | 2,315 | 17.89% |
| SizeNameDivergence 被降級 | 828 | 6.40% |
| SpecDecodeDraft 被降級 | 112 | 0.87% |
| 合計降級 | 3,255 | 25.16% |
| 可進排行榜 | 9,682 | 74.84% |
那個兩個參數的 Nano-H 確實被攔下來了,換算出來是每個參數 42.9 億個 bit,離譜到不可能漏。對照組也對:Qwen/Qwen3-8B 乾淨過關,沒有被誤殺。
但把兩組數字交叉比一次,缺口就出來了。5,633 筆零下載的資料裡,這三條規則只攔下 1,650 筆,命中率 29.3%。剩下 3,983 筆零下載的模型照樣進得了排行榜,等於整份清單的 30.8%。
原因很單純:熱門度根本沒被拿來排序。我在計分引擎 fit.rs 裡搜 hf_downloads 和 hf_likes,各是 0 次。同一支檔案裡 fn 出現 177 次、score 出現 170 次,工具沒壞,那個 0 是真的 0。下載數只在合併重複資料時用來取最大值,之後就再也沒被讀過。
llmfit 會替你判斷「這個模型的數字合不合理」,但不會替你判斷「這個模型值不值得用」。這兩件事它只做了第一件。
速度欄的數字,是量出來的還是算出來的?
兩種都有,而且 llmfit 肯告訴你是哪一種。這是它最值錢的設計。
fit.rs 裡有一個叫 EstimateConfidence 的列舉,把速度數字分成五級。註解寫得很白:「一個量出來的數字和一個公式猜出來的數字,都叫 tok/s,而直到現在都沒有東西能把它們分開。」
| 等級 | 意思 | 可信度 |
|---|---|---|
MeasuredLocal | 你自己在這台機器上跑過 llmfit bench | 最高 |
MeasuredCommunity | 別人在同款硬體上量過,隨版本內建進來 | 高 |
Calibrated | 公式估算,但用你這台機器的實測值校正過 | 中 |
Estimated | 純公式估算,背後沒有任何實測(預設值) | 低 |
Unsupported | 這個模型需要 llmfit 模擬不了的執行環境 | 無 |
注意最後一欄的括號:Estimated 被標成 #[default]。沒有任何實測資料時,你看到的就是這一級。介面上有實測的那幾行會多一個 ✓,程式碼在 tui_ui.rs 第 946 行。
社群到底量過多少?我把 293 個檔案全數了一遍
README 說得很吸引人:合併進來的每一筆實測都會隨下個版本出貨,「硬體相同的人,在自己跑 benchmark 之前就先拿到量過的 ✓ 數字」。
這句話沒有騙人。它只是沒說覆蓋率有多低。
| 社群實測資料 | 數值 |
|---|---|
| 投稿檔案數 | 293 |
| 實測結果列數 | 736 |
| 不重複機器指紋(CPU+GPU+RAM+OS) | 41 |
| 不重複模型名稱 | 549 |
| (機器, 模型) 配對 | 703 |
| 投稿時間範圍 | 2026-07-10 至 2026-09-08 |
然後是那個讓我停下來看第二次的數字。293 筆投稿裡,有 144 筆來自同一台電腦,佔 49.1%。
我打開那個資料夾裡相隔最遠的兩個檔案比對,硬體欄位一模一樣:13 代 i7-1365U、Intel Iris Xe 內顯、31 GB 記憶體、Linux、工具版本 1.1.14。一台筆電,一次量一個模型,量了 144 次。
這完全合規,工具本來就是一次 bench 存一個檔。但「293 筆社群實測」不等於 293 台機器。真正的機器多樣性是 41 台,分布還極度傾斜:
| 機器 | 量過幾個模型 | 佔 9,682 個可排名模型 |
|---|---|---|
| i7-1365U + Intel Iris Xe 內顯 | 137 | 1.41% |
| Cortex-A725 + NVIDIA GB10 | 130 | 1.34% |
| i9-10900X + AMD RX 7900 XT | 82 | 0.85% |
| Apple M4 Pro | 74 | 0.76% |
| Xeon E5-2680 v4 + GTX 1050 Ti | 63 | 0.65% |
全專案覆蓋最好的那台電腦,速度欄有實測值的比例是 1.41%。把 41 台機器一起算:703 個實測格子,除以 41 × 9,682 = 396,962 個可能的格子,覆蓋率 0.177%。
還有兩件事。作業系統分布是 Linux 239、macOS 33、Windows 21,Linux 佔 81.6%;NVIDIA 高階卡幾乎沒人投,最好的一張是 RTX 2080。內建 27 組硬體預設值裡有 RTX 5090、4090,社群那邊等於空白。
另外,隨版本內建的 benchmark_cache.json 自己記著抓取時間是 2026-08-31。這是快取檔,隔一段時間更新一次是設計,不是故障,但你看到的外部 benchmark 數字大約落後 11 天。
那它哪裡做得比同類工具好?
三個地方,而且都不是小事。
第一,記憶體計算是認真做的。很多同類工具只會拿「參數量 × 量化位元」算一個數就交差,完全忽略 KV cache。llmfit 有專門的 kv_cache_gb 函式,會讀模型的 num_key_value_heads 和 head_dim 來處理 GQA 架構,還會反推「這張卡裝完權重之後,剩下的空間夠塞多長的上下文」。
第二,MoE 模型是分開建模的。原始碼註解裡直接寫明 gpt-oss 系列是 128 個專家、4 個啟用,權重是 MXFP4 原生格式,要用每參數 4.25 bit 算而不是 4.6,否則會高估。這種細節不是抄規格表抄得出來的。
第三,被降級的模型不會消失。models.rs 的註解寫得很清楚:被過濾的資料只是不進排行榜,仍然留在清單裡可以查,而且會附上一句人看得懂的原因,像是「名字暗示約 48.0B 參數但資料寫 0.0B,差 110.8 倍,已排除於排名之外」。
最後這點是整個專案最像樣的設計。今天早上寫的那個 GitHub 日榜第一名,問題正好相反:把最重要的那句結論埋在沒人看的檔案裡。llmfit 選擇把不確定性攤在桌面上。
怎麼用才不會被估算值騙?
四個步驟,照做就好。
- 先看 ✓,再看排名。沒有 ✓ 的速度是公式算的。排行榜第一名如果沒有 ✓,它只是「理論上最適合」。
- 記憶體判斷可以信,速度判斷要打折。「塞不塞得下」是算出來的,這種算法有物理根據;「跑多快」牽涉到執行環境、驅動、散熱,公式估不準。
- 自己跑一次
llmfit bench。跑完你這台機器的數字會升級成MeasuredLocal,而且會產生一個校正係數,套用到其他還沒量過的模型上,整張表一起變準。 - 看到沒聽過的模型名字,先去 Hugging Face 查下載數。清單裡有 3,983 個零下載的模型可以進排名,而 llmfit 不會替你過濾這件事。
第三步順手做件好事:加上 --share 會幫你開一個 PR 把結果投回去。以目前 41 台機器的樣本,多一台就是多 2.4% 的硬體多樣性。手上是 RTX 4090 或 5090 的話,你的資料等於零到一。
適合誰?不適合誰?
| 情況 | |
|---|---|
| 適合 | 想在自己電腦跑模型、但不確定硬體配得上哪隻;手上有多張卡想看拆分方案;願意自己跑一次 benchmark 換準確度 |
| 適合 | 用 Ollama、llama.cpp、LM Studio、MLX 的人,它直接偵測你裝了什麼 |
| 不太適合 | 只想要「給我一個最強的推薦」就結束的人,因為預設排名沒有把熱門度算進去 |
| 不太適合 | 只用雲端 API 的人,這工具解的是本機硬體問題 |
如果你要的是「這台舊電腦到底還能不能跑大模型」,colibrì 那種把 744B 塞進 25GB 的做法是另一條路線。想直接找一隻 24GB 顯卡跑得動的多模態模型,可以看我們寫過的 Qwen3.8-27B。
常見問題
llmfit 要收費嗎?
不用。MIT 授權,原始碼全開,Windows 用 Scoop、macOS 和 Linux 也有對應安裝方式,執行檔有經過 SignPath 簽章。
它算出來的速度準不準?
看那一行有沒有 ✓。有 ✓ 代表有人在同款硬體上實際量過;沒有 ✓ 就是公式估算,預設等級是 Estimated。目前全專案覆蓋最好的機器,也只有 1.41% 的模型有實測值。
它的 12,937 個模型是哪裡來的?
從 Hugging Face 爬的,98.5% 標記為自動抓取。裡面 43.5% 的模型下載數是 0,而排序時不會用到下載數,所以冷門或實驗性的上傳也可能出現在推薦清單上。
我要不要把自己的 benchmark 投回去?
如果你的硬體不在那 41 台裡面,價值很高。尤其是 NVIDIA 高階卡和 Windows 環境,目前 Windows 只佔投稿的 7.2%。指令是 llmfit bench --all --share,可以先加 --dry-run 看會送出什麼。
結論
llmfit 該裝。它把「這台機器塞不塞得下這個模型」這件事算得比多數同類工具認真,826 個測試和 KV cache、MoE 的處理細節都在那裡。
但要記得它給你的是兩種東西混在一起:一份 12,937 筆、四成沒人用過的爬蟲清單,和一份 703 格、覆蓋率 0.177% 的實測資料。它已經幫你把這兩種標開了,剩下的是你看不看那個 ✓。
一個工具願意告訴你「這個數字我沒量過」,比給你一個漂亮數字有用得多。我們查過的開源工具裡,肯這樣做的是少數。
下次你裝一個 AI 工具,它給你的排行榜第一名,有幾行是有人真的量過的?
資料來源:AlexsJones/llmfit GitHub 倉庫與 REST API,數字截至 2026 年 9 月 11 日。
免責聲明:本文為開源專案技術查核,所有數字由作者自行從公開倉庫重算,不代表專案方立場。開源專案更新頻繁,星數、版本與資料檔內容隨時可能變動,請以官方倉庫當下狀態為準。本文不構成任何投資建議。






發表迴響