最後更新:2026 年 9 月 13 日|本文數據以官方 benchmark 表(2026-09-12)與 GitHub 倉庫現況為準

一份 9 月 12 日跑出來的音樂生成榜單上,排在第一的不是 Suno,是一個你可以自己下載的開源模型。

一句話結論:YuE2 在 WildSongBench 拿到 6.9632,是全部 17 個受測設定中的最高分,贏過 Suno v5(6.8721)與 Suno v6(6.5562);但權重是非商用授權、要 24GB 顯卡、咬字準確度還輸 Suno,所以它現在適合研究和自用,不適合拿來接案賺錢。

YuE2 是由 multimodal-art-projection 團隊在 2026 年 9 月 12 日釋出的開源音樂生成模型。給它一段歌詞和一句風格描述,它會先寫出一份「旋律 + 和弦」的譜,再把譜渲染成一首有主唱和伴奏的完整歌曲。

先講一個容易被誤讀的數字:這個倉庫現在有 7.3k 星、825 個 fork,今天新增約 210 顆。但這 7.3k 是整個倉庫從 YuE 第一代累積下來的,YuE 1 的論文 2025 年 3 月就掛上 arXiv 了。YuE2 本身才發布一天。看到「7.3k 星的音樂 AI」就以為是新模型一天衝上去的,是誤會。

YuE2 真的贏過 Suno 嗎?

在這份榜單上,是的——但要看你比的是哪一項。

測試用的是 WildSongBench,192 個提示詞,自動評分,官方標註的評測日期是 2026 年 9 月 12 日。主要指標 SongBench Avg 分數越高越好:

系統/設定SongBench Avg ↑開放權重
YuE2(best-of-8)6.9632
Mureka 96.9377
Suno v56.8721
YuE2(標準)6.7316
Suno v5.56.7150
Suno v4.56.6995
Suno v66.5562
Suno v6 Wild6.4195
MiniMax Music 36.2830
ACE-Step 1.56.0118
YuE 1(前一代)4.9165
資料來源:YuE2 官方 WildSongBench 評測表,2026-09-12。此處節錄 17 個設定中的 11 個。

兩件事值得注意。

第一,官方自己在表格下面寫了免責:排名會因指標而異,最高的幾個平均值之間的差距「並不構成統計顯著」。6.9632 和 Mureka 9 的 6.9377 差 0.0255,這個差距官方自己不敢當成真的贏。願意把這句話寫在自己榜單下面的團隊不多,這點加分。

第二,6.9632 是 best-of-8 跑出來的——生成八個候選,挑最好的那個。真正一鍵生成的標準設定是 6.7316,排在 Suno v5 後面。你在家裡按一次按鈕拿到的,是 6.7316 那一檔,不是榜首那一檔。

那 Suno 還有哪裡贏?

兩個地方,而且都是你聽得出來的地方。

指標意思YuE2Suno 最佳誰贏
SongBench Avg ↑整體歌曲品質6.96326.8721(v5)YuE2
PER ↓咬字錯誤率9.79%5.80%(v4.5)Suno
MuLan ↑貼不貼合你給的風格描述0.50510.5428(v5)Suno
AudioBox PQ ↑製作質感8.27148.1955(v5.5)YuE2

咬字錯誤率 9.79% 對 5.80%,這不是小數點的差別。翻成白話:YuE2 唱出來的歌,大約每十個音節就有一個咬不準,Suno 是每十七個一個。你放給朋友聽,最先被挑出來的就是這個。

MuLan 輸也有實際後果:你打「英式搖滾、失真吉他、悶悶的鼓」,YuE2 照做的程度比 Suno v5 低一截。想要精準命中腦中那個聲音,目前還是閉源那邊比較聽話。

YuE2 真正跟 Suno 不一樣的地方是什麼?

不是分數。是它把中間那份譜交到你手上。

Suno 是一個黑盒:丟歌詞進去,出來一首歌。不喜歡某一段,只能重生成,然後祈禱這次順眼。

YuE2 走的是兩段式。它先產出一份 ABC 記譜格式的旋律與和弦計畫,你可以把這份譜打開、看懂、改掉——改和聲、改速度、改曲式——再叫它照改好的譜重新渲染。官方把這個叫「白盒」,Python 介面也照這個拆開:plan()generate_semantic()synthesize()decode()

對會看譜的人來說,這是質變:你不再是在跟骰子談判,而是在改一份稿。對完全不看譜的人來說,這個功能等於不存在。

另外兩個能力也建在同一份譜上:

  • 零樣本翻唱:用配套的 SheetSage2 把一首現成錄音轉成譜,再換風格重唱。數據很能說明譜的重要性:有完整譜時翻唱的 CLEWS mAP 是 0.647,沒有譜只有 0.006(948 首作品上測得)。差了一百倍,而且它沒有為翻唱另外微調過模型。
  • 對話式改編:官方那個示範拿一首叫 The Last Train 的歌,走了 9 個步驟、14 個版本,從中文流行一路改到英文爵士,中途加了新和聲和一段薩克斯風獨奏。每一版的對話、譜、提示詞都公開可查。

倉庫裡還附了一個叫 yue2-music 的 agent skill(SKILL.md 格式),可以直接掛給支援 skill 的 AI 助理,讓它幫你生成、轉譜、改譜、比對不同版本。這對已經在用 Claude Code 那套工作流的人是現成的接口。

那三個 catch 是什麼?

這段是全文最該看的。跑分贏了,不代表輪到你用。

Catch 1:權重是非商用授權,你不能拿它賺錢

倉庫裡的 LICENSE 檔是 Apache 2.0,看起來很自由。但那是程式碼的授權。模型權重是 CC BY-NC 4.0,NC 就是 non-commercial,不可商業使用。

順帶一提,這裡有個容易踩的坑:release 頁面的說明寫的是「程式碼、skill、權重全部 CC BY-NC 4.0」,跟 README 的分開授權寫法不一致。對照 README 最後一句就解得開:現行倉庫原始碼是 Apache 2.0,而較早的 v0.1.6 下載封存檔沿用它自己打包時的授權。但不論走哪一條,權重都是 CC BY-NC 4.0。

實際影響:拿 YuE2 生成的歌去接案、放進商用廣告、上架串流平台收益分潤,都不在授權範圍內。要商用得另外去談(官方留了 gezhang@umich.edu 這個聯絡信箱處理授權與合作)。想直接靠 AI 音樂收錢的人,現階段還是得留在 Suno 這類有商用方案的服務。

Catch 2:要 24GB 顯存的 N 卡

官方 Quick Start 寫得很直接:Linux、Python 3.12、支援 BF16 且顯存 24GB 以上的 NVIDIA 顯卡。它輸出 48kHz 立體聲而且不做量化壓縮,所以吃得兇。

翻成中文:MacBook 跑不動,一般遊戲筆電跑不動,Windows 也不在官方支援範圍。你要嘛有一張 3090/4090 等級的卡,要嘛去租雲端 GPU。對照 Suno 打開網頁就能用,這個門檻不算低。

Catch 3:榜首那個分數不是一鍵按出來的

前面提過但值得再講一次:6.9632 是 best-of-8,等於跑八次挑一次。以 24GB 顯卡的算力來說,這代表等待時間和電費都乘以八。標準設定的 6.7316 才是日常體感,那個分數排在 Suno v5 後面。

所以我該用 YuE2 還是 Suno?

回答三個問題就知道了。

🎛️ 30 秒決定器
1. 你做出來的音樂會用在商業用途嗎(接案、廣告、上架收益)?
2. 你有 24GB 顯存的 NVIDIA 顯卡,或願意租雲端 GPU 嗎?
3. 你看得懂譜,而且想自己改旋律和和弦嗎?
請回答上面三題。

適用族群對照

你是誰建議原因
想接案/做商用配樂Suno 或其他商用方案YuE2 權重非商用授權
音樂系學生、編曲愛好者YuE2可讀可改的譜,是它獨有的
研究者、要做評測或微調YuE2權重開放、benchmark 可復現
只想快速出一首 demoSuno開網頁就能用,不用配環境
做內容、要大量背景音樂Suno(商用方案)量產 + 授權清楚
在玩 AI agent 工作流YuE2yue2-music skill,可掛進助理

YuE2 怎麼裝?

確認硬體符合(Linux + Python 3.12 + 24GB 顯存 N 卡)之後,官方流程四步:

  1. 取得原始碼git clone https://github.com/multimodal-art-projection/YuE.git,然後 cd YuE
  2. 建虛擬環境python3.12 -m venv .venv,再 source .venv/bin/activate
  3. 安裝套件python -m pip install --upgrade pip,接著 python -m pip install .。模型檔會在第一次使用時自動從 Hugging Face 下載。
  4. 生成第一首歌python examples/generate.py --output outputs/first-song,完成後打開 outputs/first-song/audio.flac。同一個資料夾還會留下譜、語意 token、聲學潛變數和生成設定,方便你回頭改。

想做翻唱就把 cot 參數設成 "melody",並且用一份不含和弦標記的譜,讓伴奏有空間配合新風格;想完全不走譜、直接從歌詞生成,設 cot="off"

還有什麼替代方案?

  • Suno:最省事,有商用方案,咬字和貼合提示詞都比 YuE2 準,但你看不到也改不到中間過程。
  • Mureka 9:這次榜上第二(6.9377),閉源,跟 YuE2 的差距在統計上分不出來,值得一起試聽比較。
  • ACE-Step 1.5(6.0118)/MiniMax Music 3(6.2830):同樣是開放權重,分數低一截,但對硬體的要求通常比較友善,顯卡不夠時可以先從這裡入門。
  • 語音而非音樂:如果你其實要的是配音、旁白而不是歌,方向不一樣,可以看我們寫過的開源語音方案 VoiceStudio

常見問題

YuE2 免費嗎?

模型本身免費下載,但只限非商業用途(權重 CC BY-NC 4.0)。真正的成本在硬體:一張 24GB 顯存的顯卡,或等值的雲端 GPU 租用費。

YuE2 可以用 Windows 或 Mac 跑嗎?

官方列的環境是 Linux + Python 3.12 + 支援 BF16 的 NVIDIA 顯卡。Windows 和 Apple 晶片的 Mac 都不在官方支援清單內。

YuE2 能唱中文嗎?

可以。官方的 agentic 示範就是從一首中文流行歌開始,一路改成英文爵士版本。不過要留意整體咬字錯誤率是 9.79%,比 Suno 高。

YuE2 跟 YuE 第一代差多少?

SongBench Avg 從 4.9165 升到 6.9632。一代的程式碼和文件保留在 YuE-v1 分支,沒有被刪掉。

什麼是 symbolic planning?

模型先寫出一份人看得懂的旋律與和弦譜(ABC 記譜格式),再照這份譜生成音訊。好處是你可以在出聲之前檢查和修改,而不是只能重擲骰子。

結論:值得裝嗎?

如果你會看譜、有顯卡、而且不打算拿這些歌去賺錢,那值得,而且它給你的東西 Suno 給不了。

其他人的話,這則新聞真正的價值是差距本身:開源音樂模型第一次在一份公開榜單上跟閉源龍頭排到同一格。一年前 YuE 1 是 4.9165,現在是 6.9632。真正該記下來的是這個斜率,不是今天誰第一。

至於那個「非商用授權」:它現在是 catch,但開源模型的授權通常會隨著版本鬆綁。等它鬆的那天,音樂外包的報價單才會真的開始改寫。

新手行動清單

  • ☐ 先去官方 demo 頁試聽,用耳朵驗證跑分,不要只看表格
  • ☐ 確認你的用途是不是商業——是的話直接跳過 YuE2
  • ☐ 查一下自己顯卡的顯存,低於 24GB 就先考慮租雲端
  • ☐ 想低成本入門,先試 ACE-Step 1.5 或 MiniMax Music 3
  • ☐ 已經在用 AI 助理工作流的,把 yue2-music skill 掛上去試一次

參考資料:YuE2 官方 GitHub 倉庫(multimodal-art-projection/YuE)README 與 WildSongBench 評測表,擷取日期 2026-09-13;倉庫 LICENSE 檔;release 頁 yue2-v0.1.6。

免責聲明:本文為工具評測,所有數據引自官方公開資料,擷取時間為 2026 年 9 月 13 日,AI 工具版本與授權條款更新頻繁,實際情況請以官方最新公告為準。使用任何 AI 音樂生成工具前,請自行確認授權範圍是否涵蓋你的用途;本文不構成法律意見。本站與文中提及的任何工具或服務均無商業合作關係。

關於Mr. Slash

「Mr. Slash 的系統性人生」,創立於 2024年,由 Mr. Slash 本人及專業編輯團隊經營的財經內容平台。

我們的宗旨是透過投資、財經、自動化與新興科技等領域的深入解說與應用,幫助讀者打造穩定的被動收入系統。內容涵蓋加密貨幣、股息資產、量化工具、平台分潤等實用策略,協助你用更聰明的方法配置資金、累積資產,走在財務自由的路上,少走冤枉路。

若為商業合作邀稿,將會清楚標註「不代表本站立場」。

商業合作

如果您有任何關於我們團隊或網站內容的疑問或建議,歡迎您前往IG 私訊 @slash.Capital聯繫我們,謝謝!

發表迴響

相關文章

最新文章

探索更多來自 Mr. Slash|系統流人生 的內容

立即訂閱即可持續閱讀,還能取得所有封存文章。

繼續閱讀

خصم دائم على الرسوم سجّل في OKX مجاناً ←
Join Mr. Slash