最後更新:2026 年 8 月 16 日(發布後 48 小時內寫成,數據以官方 model card 為準)
8 月 14 日,阿里通義把 Qwen3.8-27B 的權重放上 Hugging Face。不到三天,下載量衝破 9.1 萬次,社群做出的量化版本已經超過 350 個。
一句話結論:Qwen3.8-27B 是阿里 8 月 14 日開源的 27.78B 多模態模型(Apache 2.0 可商用),電腦操作測試 OSWorld 拿 84.3 分、反超部分雲端旗艦;4-bit 量化後一張 24GB 顯示卡跑得動,是目前 30B 級最有說服力的本地 agent 模型。
Qwen3.8-27B 是什麼?和 Qwen3.8-Max 是同一隻嗎?
先答後半:不是同一隻,差很遠。上星期我們寫過的 Qwen3.8-Max 是 2.4 兆參數的 MoE 旗艦,定位是跟 GPT、Claude 打對台的雲端大腦。這篇講的 Qwen3.8-27B 是同一代的「可下載版」:27.78B 參數的 dense 模型(Hugging Face 顯示 28B),看得懂文字、圖片和視頻,原生 262,144 token 上下文,可以用 YaRN 撐到 100 萬。授權是 Apache 2.0,下載、改、商用都不用問人。
兩個名字只差一個尾綴,Google 卻會把它們當同一件事。你搜「Qwen3.8」看到的評測,動筆前先確認講的是哪一隻。
技術上值得記一筆的是架構:64 層裡混合了 Gated DeltaNet 線性注意力和門控注意力,再加 MTP 多 token 預測。白話翻譯:這個設計是衝著「跑得快、context 拉得長」去的,跟傳統 Transformer 全程算全注意力的做法不同。思考模式預設開啟,可以用 reasoning_effort 三檔(xhigh/medium/low)控制想多深,也可以整個關掉直接答。
官方成績單裡,哪幾個數字真的重要?
重要的是 agent 那三行:電腦操作、瀏覽器操作、軟件工程。這是 27B 對上一代跳幅最大、也是對上雲端旗艦最敢叫陣的地方。以下數字全部來自官方 model card(截至 2026 年 8 月):
| 測試項目 | Qwen3.8-27B | 前代 Qwen3.6-27B | Opus4.6 Max(雲端旗艦) | Muse Glimmer-30B(Meta 開源) |
|---|---|---|---|---|
| OSWorld-Verified(電腦操作) | 84.3 | 63.9 | 72.7 | 65.9 |
| AndroidWorld(手機操作) | 81.9 | 70.3 | 62.0 | — |
| SWE-bench Pro(軟件工程) | 61.7 | 53.5 | 53.4 | 51.2 |
| DeepSWE 1.1(agent 編程) | 42.2 | 13.3 | — | — |
| Terminal-Bench 2.1(終端編程) | 73.0 | 63.4 | 78.2 | 51.7 |
| GPQA Diamond(科學推理) | 89.2 | 87.8 | 91.3 | 83.5 |
三個解讀。第一,DeepSWE 從 13.3 跳到 42.2,是三倍多,這種跳幅通常代表訓練方法換了打法,不只是加料。第二,OSWorld 的 84.3 分贏過表上那隻雲端旗艦的 72.7,一個下載得到的 27B 模型在「操作電腦」這件事上反超收費模型,2026 年之前這句話寫出來會被當標題黨。第三,別只看贏的:GPQA、HLE(30.8 對 40.0)這類知識推理題,27B 還是輸給旗艦一截,Terminal-Bench 也還差 5 分。它是專科生,不是全科狀元。
口徑提醒:這是官方自家評測,部分基準(SWE-bench Pro、NL2Repo)是廠方用 Claude Code harness 重跑並修正過題目的版本,跟原榜不完全可比。第三方複測還在陸續出爐,這份成績單看趨勢就好,絕對值先別背。
一張 24GB 顯示卡真的跑得動嗎?
量化版可以,全精度不行。這裡把帳算清楚:27.78B 參數的 BF16 全精度權重約 56GB,那是工作站級顯卡的地盤。但 Hugging Face 上社群量化版已經有 356 個,4-bit 版本的權重落在 16GB 上下,加上視覺編碼器和 KV cache,一張 24GB 的 RTX 3090 或 4090 跑短中等 context 有餘裕。想吃盡 262K 長上下文或者堅持高精度,再考慮 48GB 級或多卡。以上是第三方實測加參數估算的口徑,你的機器最終以實跑為準。
你的顯示卡跑不跑得動 Qwen3.8-27B?
部署工具鏈不用自己發明:llama.cpp、Ollama、LM Studio 都已經有對應的量化格式可直接拉。沒玩過本地模型的話,先看我們寫過的 LM Studio 新手教學或 Ollama 一行指令跑 LLM,流程一模一樣,換個模型名而已。
拿它來做什麼最值?
吃畫面的 agent 任務。這隻模型的分數分布已經把答案寫出來了:它最強的地方全部是「看著螢幕做事」的環節。三個具體場景:
- 桌面流程自動化:OSWorld 84.3 的意思是,給它看螢幕截圖、讓它點按鍵盤滑鼠完成指定任務,它的完成率已經超過多數雲端模型。重複性的報表、檔案整理、後台操作,是第一批用得上的活。
- 長文件和視頻理解:原生 262K context,官方說明支援到「小時級」視頻輸入。開會錄影、教學影片、上百頁 PDF,餵進去問問題,全程不出你的電腦。
- 本地 coding agent:官方直接用 Claude Code harness 跑評測,意思是你可以把它接進現成的 coding agent 工具鏈當引擎,DeepSWE 42.2 的分數在開源模型裡屬第一梯隊。
想現在就動手,最短路徑三步:
- 裝 Ollama 或 LM Studio(免費,五分鐘);
- 搜「Qwen3.8-27B」拉一個 4-bit 量化版(注意選 27B,不要拉錯 Max 相關衍生物);
- 要接工具或寫程式用,再用 vLLM 或 SGLang 起一個本地 API(OpenAI 相容格式,官方 model card 有現成指令)。
跟 Muse Glimmer-30B 比,開源 30B 級該選哪個?
agent 用途選 Qwen3.8-27B,沒什麼懸念。Meta 上星期才送出 Muse Glimmer 30B 權重,兩隻放在一起就是 2026 年 8 月開源 30B 級的正面對決:電腦操作 84.3 對 65.9,終端編程 73.0 對 51.7,科學推理 89.2 對 83.5,都是 Qwen 贏。Glimmer 目前的相對優勢在生態(Meta 系工具鏈)和部分寫作風格偏好,如果你的用途是純文字創作,兩隻都試過再定。順帶一提,這個級距的另一個極端是 14MB 的 Needle 2:一邊是 27B 的全能 agent,一邊是手錶都跑得動的微型 tool-calling,2026 年的本地 AI 光譜兩端都在拉開。
適用對照一句版:做桌面/手機自動化選 Qwen3.8-27B;重知識推理的研究型工作仍然是雲端旗艦的地盤;只想聊天問問題,其實不用折騰本地部署。
對想靠 AI 省錢賺錢的人,實際影響是什麼?
省的部分好算:agent 工作流最燒 token,因為它是連續幾百步的操作循環。同樣的流程搬回本地跑,帳單從「每月付」變成「一次性硬件投入」,跑得愈密回本愈快。一張二手 3090 的價錢,對照你現在每月的 API 帳單,自己按得出回本週期。
賺的部分是新開的門:醫療、法律、會計這類客戶想要自動化,但資料不能出機房,雲端 API 直接出局。一個能在客戶自己電腦上跑、還會操作螢幕的開源模型,就是接這類案子的敲門磚。Apache 2.0 授權意味著你拿它做成服務賣,法律上乾乾淨淨。
風險與限制,先講清楚
- 成績單是官方自評,複測生態還沒跟上,數字看趨勢別背絕對值;
- 知識推理和長難題(GPQA、HLE)明確輸旗艦,拿它寫深度研究會失望;
- 本地部署有學習成本,量化選錯、參數亂調,體感會比帳面差很多;
- 27B 級的幻覺沒有消失,關鍵輸出照樣要人工核;
- 官方託管版(Qwen Cloud,預設 1M context)還沒上線,想省事等 API 的人要再等等。
FAQ:關於 Qwen3.8-27B 的快問快答
Qwen3.8-27B 免費嗎?可以商用嗎?
權重免費下載,授權 Apache 2.0,可以商用、可以改、可以拿去做產品,不需要另外授權。要花錢的只有你的硬件和電費;之後上線的官方 API 託管版另計。
它和 Qwen3.8-Max 差在哪?
Max 是 2.4 兆參數的 MoE 雲端旗艦,27B 是同代的 dense 可下載版。一個住在數據中心,一個住在你的顯示卡裡。兩隻都叫 Qwen3.8,看評測時先確認講的是哪隻。
最低需要什麼硬件?
主流甜蜜點是 24GB VRAM(RTX 3090/4090)跑 4-bit 量化版。16GB 塞得進但很緊,全精度 BF16 約需 56GB。用上面的自查器對一下你的卡。
它比 ChatGPT、Claude 強嗎?
單看電腦操作類測試(OSWorld、AndroidWorld),官方數據贏過部分雲端旗艦;知識推理類仍然輸。準確的說法是:它是目前最能打的「本地 agent 執行器」之一,取代不了雲端旗艦的全科能力。
新手行動清單
- ☑ 用文中的自查器對一下你的 VRAM,確認能跑哪一檔量化;
- ☑ 裝 Ollama 或 LM Studio,拉 4-bit 版跑第一個對話;
- ☑ 丟一張截圖或一段短視頻進去,試它的多模態理解;
- ☑ 有 coding 需求的,接上你現有的 agent 工具鏈跑一個小任務對比雲端;
- ☑ 把你每月 API 帳單和一張 24GB 卡的價錢放在一起,算回本週期。
延伸閱讀
- Qwen3.8-Max 是什麼?AI 連續寫 16 天程式交出 265 個 commit
- Meta 免費送出 Muse Glimmer 30B 權重,AI 開源已分兩條路
- Needle 2 只有 14MB,主榜卻排第三
- LM Studio:新手最友善的本地 LLM 工具
參考資料
- Qwen/Qwen3.8-27B 官方 model card(Hugging Face)
- Qwen3.8 官方發布說明(Qwen Team)
- Qwen3.8-27B 硬件需求第三方分析(kingy.ai)
- Qwen3.8-27B 技術分析(Local AI Zone)
免責聲明:本文為資訊整理與個人使用心得分享,非投資建議。AI 模型的評測數據、硬件需求與授權條款可能隨版本更新而變動,請以官方最新公告為準。文中提及的硬件購置與部署決策,請依自身需求與預算評估。





發表迴響