最後更新:2026 年 8 月 16 日(發布後 48 小時內寫成,數據以官方 model card 為準)

8 月 14 日,阿里通義把 Qwen3.8-27B 的權重放上 Hugging Face。不到三天,下載量衝破 9.1 萬次,社群做出的量化版本已經超過 350 個。

一句話結論:Qwen3.8-27B 是阿里 8 月 14 日開源的 27.78B 多模態模型(Apache 2.0 可商用),電腦操作測試 OSWorld 拿 84.3 分、反超部分雲端旗艦;4-bit 量化後一張 24GB 顯示卡跑得動,是目前 30B 級最有說服力的本地 agent 模型。

Qwen3.8-27B 是什麼?和 Qwen3.8-Max 是同一隻嗎?

先答後半:不是同一隻,差很遠。上星期我們寫過的 Qwen3.8-Max 是 2.4 兆參數的 MoE 旗艦,定位是跟 GPT、Claude 打對台的雲端大腦。這篇講的 Qwen3.8-27B 是同一代的「可下載版」:27.78B 參數的 dense 模型(Hugging Face 顯示 28B),看得懂文字、圖片和視頻,原生 262,144 token 上下文,可以用 YaRN 撐到 100 萬。授權是 Apache 2.0,下載、改、商用都不用問人。

兩個名字只差一個尾綴,Google 卻會把它們當同一件事。你搜「Qwen3.8」看到的評測,動筆前先確認講的是哪一隻。

技術上值得記一筆的是架構:64 層裡混合了 Gated DeltaNet 線性注意力和門控注意力,再加 MTP 多 token 預測。白話翻譯:這個設計是衝著「跑得快、context 拉得長」去的,跟傳統 Transformer 全程算全注意力的做法不同。思考模式預設開啟,可以用 reasoning_effort 三檔(xhigh/medium/low)控制想多深,也可以整個關掉直接答。

官方成績單裡,哪幾個數字真的重要?

重要的是 agent 那三行:電腦操作、瀏覽器操作、軟件工程。這是 27B 對上一代跳幅最大、也是對上雲端旗艦最敢叫陣的地方。以下數字全部來自官方 model card(截至 2026 年 8 月):

測試項目Qwen3.8-27B前代 Qwen3.6-27BOpus4.6 Max(雲端旗艦)Muse Glimmer-30B(Meta 開源)
OSWorld-Verified(電腦操作)84.363.972.765.9
AndroidWorld(手機操作)81.970.362.0
SWE-bench Pro(軟件工程)61.753.553.451.2
DeepSWE 1.1(agent 編程)42.213.3
Terminal-Bench 2.1(終端編程)73.063.478.251.7
GPQA Diamond(科學推理)89.287.891.383.5

三個解讀。第一,DeepSWE 從 13.3 跳到 42.2,是三倍多,這種跳幅通常代表訓練方法換了打法,不只是加料。第二,OSWorld 的 84.3 分贏過表上那隻雲端旗艦的 72.7,一個下載得到的 27B 模型在「操作電腦」這件事上反超收費模型,2026 年之前這句話寫出來會被當標題黨。第三,別只看贏的:GPQA、HLE(30.8 對 40.0)這類知識推理題,27B 還是輸給旗艦一截,Terminal-Bench 也還差 5 分。它是專科生,不是全科狀元。

口徑提醒:這是官方自家評測,部分基準(SWE-bench Pro、NL2Repo)是廠方用 Claude Code harness 重跑並修正過題目的版本,跟原榜不完全可比。第三方複測還在陸續出爐,這份成績單看趨勢就好,絕對值先別背。

一張 24GB 顯示卡真的跑得動嗎?

量化版可以,全精度不行。這裡把帳算清楚:27.78B 參數的 BF16 全精度權重約 56GB,那是工作站級顯卡的地盤。但 Hugging Face 上社群量化版已經有 356 個,4-bit 版本的權重落在 16GB 上下,加上視覺編碼器和 KV cache,一張 24GB 的 RTX 3090 或 4090 跑短中等 context 有餘裕。想吃盡 262K 長上下文或者堅持高精度,再考慮 48GB 級或多卡。以上是第三方實測加參數估算的口徑,你的機器最終以實跑為準。

你的顯示卡跑不跑得動 Qwen3.8-27B?

部署工具鏈不用自己發明:llama.cpp、Ollama、LM Studio 都已經有對應的量化格式可直接拉。沒玩過本地模型的話,先看我們寫過的 LM Studio 新手教學Ollama 一行指令跑 LLM,流程一模一樣,換個模型名而已。

拿它來做什麼最值?

吃畫面的 agent 任務。這隻模型的分數分布已經把答案寫出來了:它最強的地方全部是「看著螢幕做事」的環節。三個具體場景:

  1. 桌面流程自動化:OSWorld 84.3 的意思是,給它看螢幕截圖、讓它點按鍵盤滑鼠完成指定任務,它的完成率已經超過多數雲端模型。重複性的報表、檔案整理、後台操作,是第一批用得上的活。
  2. 長文件和視頻理解:原生 262K context,官方說明支援到「小時級」視頻輸入。開會錄影、教學影片、上百頁 PDF,餵進去問問題,全程不出你的電腦。
  3. 本地 coding agent:官方直接用 Claude Code harness 跑評測,意思是你可以把它接進現成的 coding agent 工具鏈當引擎,DeepSWE 42.2 的分數在開源模型裡屬第一梯隊。

想現在就動手,最短路徑三步:

  1. 裝 Ollama 或 LM Studio(免費,五分鐘);
  2. 搜「Qwen3.8-27B」拉一個 4-bit 量化版(注意選 27B,不要拉錯 Max 相關衍生物);
  3. 要接工具或寫程式用,再用 vLLM 或 SGLang 起一個本地 API(OpenAI 相容格式,官方 model card 有現成指令)。

跟 Muse Glimmer-30B 比,開源 30B 級該選哪個?

agent 用途選 Qwen3.8-27B,沒什麼懸念。Meta 上星期才送出 Muse Glimmer 30B 權重,兩隻放在一起就是 2026 年 8 月開源 30B 級的正面對決:電腦操作 84.3 對 65.9,終端編程 73.0 對 51.7,科學推理 89.2 對 83.5,都是 Qwen 贏。Glimmer 目前的相對優勢在生態(Meta 系工具鏈)和部分寫作風格偏好,如果你的用途是純文字創作,兩隻都試過再定。順帶一提,這個級距的另一個極端是 14MB 的 Needle 2:一邊是 27B 的全能 agent,一邊是手錶都跑得動的微型 tool-calling,2026 年的本地 AI 光譜兩端都在拉開。

適用對照一句版:做桌面/手機自動化選 Qwen3.8-27B;重知識推理的研究型工作仍然是雲端旗艦的地盤;只想聊天問問題,其實不用折騰本地部署。

對想靠 AI 省錢賺錢的人,實際影響是什麼?

省的部分好算:agent 工作流最燒 token,因為它是連續幾百步的操作循環。同樣的流程搬回本地跑,帳單從「每月付」變成「一次性硬件投入」,跑得愈密回本愈快。一張二手 3090 的價錢,對照你現在每月的 API 帳單,自己按得出回本週期。

賺的部分是新開的門:醫療、法律、會計這類客戶想要自動化,但資料不能出機房,雲端 API 直接出局。一個能在客戶自己電腦上跑、還會操作螢幕的開源模型,就是接這類案子的敲門磚。Apache 2.0 授權意味著你拿它做成服務賣,法律上乾乾淨淨。

風險與限制,先講清楚

  • 成績單是官方自評,複測生態還沒跟上,數字看趨勢別背絕對值;
  • 知識推理和長難題(GPQA、HLE)明確輸旗艦,拿它寫深度研究會失望;
  • 本地部署有學習成本,量化選錯、參數亂調,體感會比帳面差很多;
  • 27B 級的幻覺沒有消失,關鍵輸出照樣要人工核;
  • 官方託管版(Qwen Cloud,預設 1M context)還沒上線,想省事等 API 的人要再等等。

FAQ:關於 Qwen3.8-27B 的快問快答

Qwen3.8-27B 免費嗎?可以商用嗎?

權重免費下載,授權 Apache 2.0,可以商用、可以改、可以拿去做產品,不需要另外授權。要花錢的只有你的硬件和電費;之後上線的官方 API 託管版另計。

它和 Qwen3.8-Max 差在哪?

Max 是 2.4 兆參數的 MoE 雲端旗艦,27B 是同代的 dense 可下載版。一個住在數據中心,一個住在你的顯示卡裡。兩隻都叫 Qwen3.8,看評測時先確認講的是哪隻。

最低需要什麼硬件?

主流甜蜜點是 24GB VRAM(RTX 3090/4090)跑 4-bit 量化版。16GB 塞得進但很緊,全精度 BF16 約需 56GB。用上面的自查器對一下你的卡。

它比 ChatGPT、Claude 強嗎?

單看電腦操作類測試(OSWorld、AndroidWorld),官方數據贏過部分雲端旗艦;知識推理類仍然輸。準確的說法是:它是目前最能打的「本地 agent 執行器」之一,取代不了雲端旗艦的全科能力。

新手行動清單

  • ☑ 用文中的自查器對一下你的 VRAM,確認能跑哪一檔量化;
  • ☑ 裝 Ollama 或 LM Studio,拉 4-bit 版跑第一個對話;
  • ☑ 丟一張截圖或一段短視頻進去,試它的多模態理解;
  • ☑ 有 coding 需求的,接上你現有的 agent 工具鏈跑一個小任務對比雲端;
  • ☑ 把你每月 API 帳單和一張 24GB 卡的價錢放在一起,算回本週期。

延伸閱讀

參考資料

免責聲明:本文為資訊整理與個人使用心得分享,非投資建議。AI 模型的評測數據、硬件需求與授權條款可能隨版本更新而變動,請以官方最新公告為準。文中提及的硬件購置與部署決策,請依自身需求與預算評估。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

Trending

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash