最後更新:2026 年 9 月 13 日|本文數據以官方 benchmark 表(2026-09-12)與 GitHub 倉庫現況為準
一份 9 月 12 日跑出來的音樂生成榜單上,排在第一的不是 Suno,是一個你可以自己下載的開源模型。
一句話結論:YuE2 在 WildSongBench 拿到 6.9632,是全部 17 個受測設定中的最高分,贏過 Suno v5(6.8721)與 Suno v6(6.5562);但權重是非商用授權、要 24GB 顯卡、咬字準確度還輸 Suno,所以它現在適合研究和自用,不適合拿來接案賺錢。
YuE2 是由 multimodal-art-projection 團隊在 2026 年 9 月 12 日釋出的開源音樂生成模型。給它一段歌詞和一句風格描述,它會先寫出一份「旋律 + 和弦」的譜,再把譜渲染成一首有主唱和伴奏的完整歌曲。
先講一個容易被誤讀的數字:這個倉庫現在有 7.3k 星、825 個 fork,今天新增約 210 顆。但這 7.3k 是整個倉庫從 YuE 第一代累積下來的,YuE 1 的論文 2025 年 3 月就掛上 arXiv 了。YuE2 本身才發布一天。看到「7.3k 星的音樂 AI」就以為是新模型一天衝上去的,是誤會。
YuE2 真的贏過 Suno 嗎?
在這份榜單上,是的——但要看你比的是哪一項。
測試用的是 WildSongBench,192 個提示詞,自動評分,官方標註的評測日期是 2026 年 9 月 12 日。主要指標 SongBench Avg 分數越高越好:
| 系統/設定 | SongBench Avg ↑ | 開放權重 |
|---|---|---|
| YuE2(best-of-8) | 6.9632 | 是 |
| Mureka 9 | 6.9377 | 否 |
| Suno v5 | 6.8721 | 否 |
| YuE2(標準) | 6.7316 | 是 |
| Suno v5.5 | 6.7150 | 否 |
| Suno v4.5 | 6.6995 | 否 |
| Suno v6 | 6.5562 | 否 |
| Suno v6 Wild | 6.4195 | 否 |
| MiniMax Music 3 | 6.2830 | 是 |
| ACE-Step 1.5 | 6.0118 | 是 |
| YuE 1(前一代) | 4.9165 | 是 |
兩件事值得注意。
第一,官方自己在表格下面寫了免責:排名會因指標而異,最高的幾個平均值之間的差距「並不構成統計顯著」。6.9632 和 Mureka 9 的 6.9377 差 0.0255,這個差距官方自己不敢當成真的贏。願意把這句話寫在自己榜單下面的團隊不多,這點加分。
第二,6.9632 是 best-of-8 跑出來的——生成八個候選,挑最好的那個。真正一鍵生成的標準設定是 6.7316,排在 Suno v5 後面。你在家裡按一次按鈕拿到的,是 6.7316 那一檔,不是榜首那一檔。
那 Suno 還有哪裡贏?
兩個地方,而且都是你聽得出來的地方。
| 指標 | 意思 | YuE2 | Suno 最佳 | 誰贏 |
|---|---|---|---|---|
| SongBench Avg ↑ | 整體歌曲品質 | 6.9632 | 6.8721(v5) | YuE2 |
| PER ↓ | 咬字錯誤率 | 9.79% | 5.80%(v4.5) | Suno |
| MuLan ↑ | 貼不貼合你給的風格描述 | 0.5051 | 0.5428(v5) | Suno |
| AudioBox PQ ↑ | 製作質感 | 8.2714 | 8.1955(v5.5) | YuE2 |
咬字錯誤率 9.79% 對 5.80%,這不是小數點的差別。翻成白話:YuE2 唱出來的歌,大約每十個音節就有一個咬不準,Suno 是每十七個一個。你放給朋友聽,最先被挑出來的就是這個。
MuLan 輸也有實際後果:你打「英式搖滾、失真吉他、悶悶的鼓」,YuE2 照做的程度比 Suno v5 低一截。想要精準命中腦中那個聲音,目前還是閉源那邊比較聽話。
YuE2 真正跟 Suno 不一樣的地方是什麼?
不是分數。是它把中間那份譜交到你手上。
Suno 是一個黑盒:丟歌詞進去,出來一首歌。不喜歡某一段,只能重生成,然後祈禱這次順眼。
YuE2 走的是兩段式。它先產出一份 ABC 記譜格式的旋律與和弦計畫,你可以把這份譜打開、看懂、改掉——改和聲、改速度、改曲式——再叫它照改好的譜重新渲染。官方把這個叫「白盒」,Python 介面也照這個拆開:plan() → generate_semantic() → synthesize() → decode()。
對會看譜的人來說,這是質變:你不再是在跟骰子談判,而是在改一份稿。對完全不看譜的人來說,這個功能等於不存在。
另外兩個能力也建在同一份譜上:
- 零樣本翻唱:用配套的 SheetSage2 把一首現成錄音轉成譜,再換風格重唱。數據很能說明譜的重要性:有完整譜時翻唱的 CLEWS mAP 是 0.647,沒有譜只有 0.006(948 首作品上測得)。差了一百倍,而且它沒有為翻唱另外微調過模型。
- 對話式改編:官方那個示範拿一首叫 The Last Train 的歌,走了 9 個步驟、14 個版本,從中文流行一路改到英文爵士,中途加了新和聲和一段薩克斯風獨奏。每一版的對話、譜、提示詞都公開可查。
倉庫裡還附了一個叫 yue2-music 的 agent skill(SKILL.md 格式),可以直接掛給支援 skill 的 AI 助理,讓它幫你生成、轉譜、改譜、比對不同版本。這對已經在用 Claude Code 那套工作流的人是現成的接口。
那三個 catch 是什麼?
這段是全文最該看的。跑分贏了,不代表輪到你用。
Catch 1:權重是非商用授權,你不能拿它賺錢
倉庫裡的 LICENSE 檔是 Apache 2.0,看起來很自由。但那是程式碼的授權。模型權重是 CC BY-NC 4.0,NC 就是 non-commercial,不可商業使用。
順帶一提,這裡有個容易踩的坑:release 頁面的說明寫的是「程式碼、skill、權重全部 CC BY-NC 4.0」,跟 README 的分開授權寫法不一致。對照 README 最後一句就解得開:現行倉庫原始碼是 Apache 2.0,而較早的 v0.1.6 下載封存檔沿用它自己打包時的授權。但不論走哪一條,權重都是 CC BY-NC 4.0。
實際影響:拿 YuE2 生成的歌去接案、放進商用廣告、上架串流平台收益分潤,都不在授權範圍內。要商用得另外去談(官方留了 gezhang@umich.edu 這個聯絡信箱處理授權與合作)。想直接靠 AI 音樂收錢的人,現階段還是得留在 Suno 這類有商用方案的服務。
Catch 2:要 24GB 顯存的 N 卡
官方 Quick Start 寫得很直接:Linux、Python 3.12、支援 BF16 且顯存 24GB 以上的 NVIDIA 顯卡。它輸出 48kHz 立體聲而且不做量化壓縮,所以吃得兇。
翻成中文:MacBook 跑不動,一般遊戲筆電跑不動,Windows 也不在官方支援範圍。你要嘛有一張 3090/4090 等級的卡,要嘛去租雲端 GPU。對照 Suno 打開網頁就能用,這個門檻不算低。
Catch 3:榜首那個分數不是一鍵按出來的
前面提過但值得再講一次:6.9632 是 best-of-8,等於跑八次挑一次。以 24GB 顯卡的算力來說,這代表等待時間和電費都乘以八。標準設定的 6.7316 才是日常體感,那個分數排在 Suno v5 後面。
所以我該用 YuE2 還是 Suno?
回答三個問題就知道了。
適用族群對照
| 你是誰 | 建議 | 原因 |
|---|---|---|
| 想接案/做商用配樂 | Suno 或其他商用方案 | YuE2 權重非商用授權 |
| 音樂系學生、編曲愛好者 | YuE2 | 可讀可改的譜,是它獨有的 |
| 研究者、要做評測或微調 | YuE2 | 權重開放、benchmark 可復現 |
| 只想快速出一首 demo | Suno | 開網頁就能用,不用配環境 |
| 做內容、要大量背景音樂 | Suno(商用方案) | 量產 + 授權清楚 |
| 在玩 AI agent 工作流 | YuE2 | 附 yue2-music skill,可掛進助理 |
YuE2 怎麼裝?
確認硬體符合(Linux + Python 3.12 + 24GB 顯存 N 卡)之後,官方流程四步:
- 取得原始碼:
git clone https://github.com/multimodal-art-projection/YuE.git,然後cd YuE。 - 建虛擬環境:
python3.12 -m venv .venv,再source .venv/bin/activate。 - 安裝套件:
python -m pip install --upgrade pip,接著python -m pip install .。模型檔會在第一次使用時自動從 Hugging Face 下載。 - 生成第一首歌:
python examples/generate.py --output outputs/first-song,完成後打開outputs/first-song/audio.flac。同一個資料夾還會留下譜、語意 token、聲學潛變數和生成設定,方便你回頭改。
想做翻唱就把 cot 參數設成 "melody",並且用一份不含和弦標記的譜,讓伴奏有空間配合新風格;想完全不走譜、直接從歌詞生成,設 cot="off"。
還有什麼替代方案?
- Suno:最省事,有商用方案,咬字和貼合提示詞都比 YuE2 準,但你看不到也改不到中間過程。
- Mureka 9:這次榜上第二(6.9377),閉源,跟 YuE2 的差距在統計上分不出來,值得一起試聽比較。
- ACE-Step 1.5(6.0118)/MiniMax Music 3(6.2830):同樣是開放權重,分數低一截,但對硬體的要求通常比較友善,顯卡不夠時可以先從這裡入門。
- 語音而非音樂:如果你其實要的是配音、旁白而不是歌,方向不一樣,可以看我們寫過的開源語音方案 VoiceStudio。
常見問題
YuE2 免費嗎?
模型本身免費下載,但只限非商業用途(權重 CC BY-NC 4.0)。真正的成本在硬體:一張 24GB 顯存的顯卡,或等值的雲端 GPU 租用費。
YuE2 可以用 Windows 或 Mac 跑嗎?
官方列的環境是 Linux + Python 3.12 + 支援 BF16 的 NVIDIA 顯卡。Windows 和 Apple 晶片的 Mac 都不在官方支援清單內。
YuE2 能唱中文嗎?
可以。官方的 agentic 示範就是從一首中文流行歌開始,一路改成英文爵士版本。不過要留意整體咬字錯誤率是 9.79%,比 Suno 高。
YuE2 跟 YuE 第一代差多少?
SongBench Avg 從 4.9165 升到 6.9632。一代的程式碼和文件保留在 YuE-v1 分支,沒有被刪掉。
什麼是 symbolic planning?
模型先寫出一份人看得懂的旋律與和弦譜(ABC 記譜格式),再照這份譜生成音訊。好處是你可以在出聲之前檢查和修改,而不是只能重擲骰子。
結論:值得裝嗎?
如果你會看譜、有顯卡、而且不打算拿這些歌去賺錢,那值得,而且它給你的東西 Suno 給不了。
其他人的話,這則新聞真正的價值是差距本身:開源音樂模型第一次在一份公開榜單上跟閉源龍頭排到同一格。一年前 YuE 1 是 4.9165,現在是 6.9632。真正該記下來的是這個斜率,不是今天誰第一。
至於那個「非商用授權」:它現在是 catch,但開源模型的授權通常會隨著版本鬆綁。等它鬆的那天,音樂外包的報價單才會真的開始改寫。
新手行動清單
- ☐ 先去官方 demo 頁試聽,用耳朵驗證跑分,不要只看表格
- ☐ 確認你的用途是不是商業——是的話直接跳過 YuE2
- ☐ 查一下自己顯卡的顯存,低於 24GB 就先考慮租雲端
- ☐ 想低成本入門,先試 ACE-Step 1.5 或 MiniMax Music 3
- ☐ 已經在用 AI 助理工作流的,把
yue2-musicskill 掛上去試一次
參考資料:YuE2 官方 GitHub 倉庫(multimodal-art-projection/YuE)README 與 WildSongBench 評測表,擷取日期 2026-09-13;倉庫 LICENSE 檔;release 頁 yue2-v0.1.6。
免責聲明:本文為工具評測,所有數據引自官方公開資料,擷取時間為 2026 年 9 月 13 日,AI 工具版本與授權條款更新頻繁,實際情況請以官方最新公告為準。使用任何 AI 音樂生成工具前,請自行確認授權範圍是否涵蓋你的用途;本文不構成法律意見。本站與文中提及的任何工具或服務均無商業合作關係。







發表迴響