為什麼要測
Suno 從 2026 年 9 月 3 日起改了下載規則:Pro 會員每月 20 次下載、Premier 60 次、免費版終身 7 次,而且連 9 月 3 日之前做的歌也算在額度內。生成額度沒變,變的是「能不能把檔案拿走」。
我的歌大多是拿來配影片、做 Shorts、當作品集背景,一個月 20 首其實不太夠,尤其是剪片時常常要多做幾版挑。於是花了幾天把目前能在自己電腦上跑的開源音樂模型全部裝起來,認真比一輪。
先講清楚兩件事。第一,這篇不拿 Suno 進來比。我自己聽過之後的感想是 Suno 的歌還是比較好聽,這點不用測。這篇要回答的是另一個問題:如果 Suno 的額度留給主打歌,剩下的 BGM、音效、草稿、大量嘗試,開源模型接不接得住。第二,好不好聽以我自己的耳朵為準。音樂沒有像素可以比對,我能給的是把所有結果放上來,讓你自己聽。
快速結論
- 有人聲的歌,ACE-Step 1.5 幾乎完勝。古風與華語題的曲風對得上、聽得出旋律,是三個歌曲模型裡最好聽的。中文咬字仍會有個別字唱錯,快板、字多的歌錯得較多。
- 民俗舞曲是三個模型共同的弱項:匈牙利、俄羅斯、巴爾幹、以色列、烏克蘭五題聽起來都像進行曲,不到能配舞的程度。
- ACE-Step 的 XL 版和一般 Turbo 版我分不出高下,兩個都不錯。網路上的評價也是這樣:XL 加強的是音質細節,不是音樂性。所以從一個 10GB 的 Turbo 整合檔開始就夠了。
- BGM 與音效請用 Stable Audio 3。純器樂鋪底它比 ACE-Step 好,音效更是只有它能做。三個版本裡 Medium 兩邊都最強,只抓它一個就好。
- MiniMax Music 3 混音乾淨、歌詞逐句跟得很緊,但速度慢很多,而且會自己判斷歌唱完了就提前結束,純器樂幾乎都做不到指定長度。
- HeartMuLa 3B 的古風容易做成爵士輕快風,不是古典味;加重「古典、莊重」的標籤只救回來一點。BGM 也不理想。
- 沒有一個開源模型會取代 Suno。它們的價值是無限量、在本機、可商用,適合拿來做 BGM、音效、草稿和大量嘗試。
受測模型
歌曲模型三個,加上一個專門做 BGM 與音效的模型。全部在 ComfyUI 裡跑,其中只有 HeartMuLa 需要裝社群節點,其他三個都是 ComfyUI 原生支援。
| 模型 | 定位 | 顯存需求 | 授權 | 安裝 |
|---|---|---|---|---|
| ACE-Step 1.5(Turbo 整合檔) | 歌曲,有人聲 | 低,顯存有限的電腦也能跑 | MIT | ComfyUI 原生 |
| ACE-Step 1.5 XL Turbo | 同上,加大版 | 中,建議顯存充足 | MIT | ComfyUI 原生 |
| MiniMax Music 3 | 歌曲,有人聲,最長五分鐘 | 中 | 社群授權,可商用但需標示模型名 | ComfyUI 原生 |
| HeartMuLa 3B | 歌曲,有人聲,多語 | 中高 | Apache-2.0 | 社群節點,依賴要手動處理 |
| Stable Audio 3(Small 兩版、Medium) | BGM、音效、可變長度 | 低 | Stability 社群授權,年營收門檻內可商用 | ComfyUI 原生 |
HeartMuLa 的 7B 版官方說品質接近 Suno,但到目前為止只釋出 3B,所以這篇測的是 3B。Sony 的 Woosh、TangoFlux、AudioX 這幾個音效模型因為公開權重是非商用授權,剪片正式用途不能拿它們的輸出,這次沒有納入。
測試方法
- 歌曲 11 題:中國古風 4 題(抒情女聲、戲腔、豪邁男聲、輕快民歌)、西方傳統民俗舞曲 5 題(匈牙利查爾達什慢轉快、俄羅斯舞曲逐段加速、巴爾幹 7/8 拍圓舞、以色列 hora、烏克蘭霍帕克純器樂)、融合與對照 2 題(琵琶配匈牙利小提琴、現代華語抒情)。古風與華語題全部中文歌詞,民俗舞曲題英文歌詞。
- BGM 6 題:60 秒純器樂,剪片最常用的幾種:Lo-fi 讀書、輕快 Vlog 開場、紀錄片懸疑鋪底、旅遊木吉他、古箏茶席鋪底、民俗舞曲練習用循環。
- 音效 12 題:雨打窗、碎石腳步、木門吱呀甩上、轉場 whoosh、UI 點擊、咖啡館氛圍、貓叫呼嚕、煙火、機械鍵盤、海浪、剪紙摺紙手作、玻璃摔破。
- 每一題只寫一份規格(曲風、BPM、調性、拍號、人聲、樂器、情緒)和一份歌詞,再由程式轉成各家要的格式:ACE-Step 和 HeartMuLa 吃逗號標籤,MiniMax 吃一段三段式的文字描述,Stable Audio 3 吃一句自然語言。同一題各模型用同一個 seed。
- 民俗舞曲題我選匈牙利、俄羅斯、巴爾幹、以色列、烏克蘭,因為這是我平常跳的傳統土風舞,聽得出對不對味。
- 每題每模型只生一次,不挑最好的一次。這對「一次就要能用」的人比較公平,但也代表運氣成分存在。
- 完整歌詞、曲風規格與三種模型各自的 prompt 寫法篇幅太長,另外整理成一篇:開源歌曲模型評比題目全公開。本文的播放器旁只標題目名稱。
需要揭露的限制:只有我一個人的耳朵;MiniMax 沒有官方的音效功能,音效題只跑 Stable Audio 3;HeartMuLa 的歌曲題我另外加跑了一輪加重古典標籤的版本,放在後面的對照區。
古風:ACE-Step 的味道最正確
四題古風裡,ACE-Step 是唯一每一題都做出「古風該有的樣子」的模型。慢板的長安夜雨有古箏和簫的氣氛,江湖令的男聲夠豪邁,戲腔那題也有做出轉換。
HeartMuLa 的問題很一致:曲風會往爵士、輕快的方向跑,古箏琵琶變成了裝飾,聽起來像國風咖啡廳音樂而不是古典感。我懷疑是標籤下得不夠重,所以另外用「traditional chinese classical music, ancient court style, solemn and elegant, not jazz, not swing」重跑了四題。結果是有稍微救回來,但味道還是 ACE-Step 比較正確。
MiniMax 的古風乾淨、歌詞咬字清楚,但情緒比較平。
中文咬字要另外說一下:即使是整體表現最好的 ACE-Step,也會有個別的字唱錯,不是每首都能整首正確。四題裡錯得最多的是江湖令,它是四題中速度最快、每句字數最多的一首;慢板的長安夜雨相對好得多。如果歌詞裡有非唱對不可的關鍵字,要有多生幾次再挑的心理準備。
長安夜雨
鏡花戲
民俗舞曲:三個模型都做成了進行曲
這一章我藏了幾個結構考題:查爾達什要從慢的 lassú 轉成快的 friss,俄羅斯舞曲每段副歌要加速,巴爾幹那題是 7/8 拍,霍帕克是純器樂。結果是這章沒有贏家。三個模型的五題聽起來都很像進行曲:節拍方正、鼓點一板一眼,樂器的名字有出來,但少了跳舞時身體會跟著晃的搖擺感和自由度。這些是我平常跳的舞,所以聽得出差在哪。
ACE-Step 相對之下還是最順耳的,但順耳和對味是兩回事,這章的輸出我不會拿去配舞。如果你要的是能跟著跳的傳統民俗舞曲,目前的開源模型還做不到,建議還是找真實錄音。
Csárdás at Harvest Moon(匈牙利查爾達什)
Kolo by the Plum Orchard(巴爾幹 7/8 圓舞)
XL 版和一般版,分不出高下
ACE-Step 1.5 今年四月出了 XL 系列,把擴散解碼器從 2B 加大到 4B,官方說音質更好。我把 11 題用兩個版本各跑一次,老實說分不出來哪個比較好,兩個都不錯。
網路上的評價和我的感覺一致。GitHub 上有人做了同樣的比較,結論是 XL 的音質確實比較好,但旋律和和聲的邏輯反而不如 2B 版;官方工作流平台也把 2B 的整合檔當預設,只在音質不夠時才建議切 XL。另一篇被廣泛引用的技術回饋指出整個 1.5 家族的通病是「技術正確但缺乏演奏表現力」,這不是 XL 特有的,兩版都一樣。
所以我的建議是:從一個 10GB 的 Turbo 整合檔開始,顯存有限的電腦也跑得動,速度還比 XL 快。顯存充足又在意人聲清晰度的人再去抓 XL。
絲路駝鈴(中西融合)
MiniMax Music 3:乾淨,但會自己收尾
MiniMax 的混音是三個裡最乾淨的,歌詞逐句對得很緊,段落標籤也真的會照做。代價是速度,它一次一格地生成,一首歌要等好幾分鐘,ACE-Step 同一首不用一分鐘。
更需要知道的是它的長度行為。你給它的秒數是上限,不是目標,它覺得歌唱完了就會停。有歌詞的題目偶爾提早幾秒到十幾秒,純器樂的題目幾乎必定提早:六題 60 秒的 BGM 沒有一題做滿,最短的只做了 15 秒。純器樂的霍帕克也只做了一半。如果你要的是固定長度的鋪底,這會很麻煩。
深夜便利店(現代華語流行對照)
BGM:Stable Audio 3 第一,ACE-Step 第二
這章比的是「剪片時要一段 60 秒純器樂鋪底,誰最好用」。我的排序是 Stable Audio 3 > ACE-Step > MiniMax > HeartMuLa。
Stable Audio 3 是 Stability AI 今年五月開源的音訊模型家族,本來就是做 BGM 與音效的,可變長度,指定幾秒就是幾秒。它的速度和其他模型不在同一個量級,任何長度都是幾秒鐘出檔,剪片時想多做幾版挑完全不心疼。ACE-Step 做純器樂也可以,長度精準,但氣氛不如 Stable Audio 3。MiniMax 勉強可用,主要卡在前面說的提前收尾。HeartMuLa 的 BGM 我覺得不太行。
古箏氛圍鋪底(茶席/手作影片)
紀錄片懸疑鋪底
音效:Medium 版兩邊都最好
音效只有 Stable Audio 3 能做,所以這章比的是它自己的三個版本:Small-SFX(官方標榜音效專用)、Small-Music、Medium。結果出乎意料:Medium > Small-Music > Small-SFX,標榜音效專用的 Small-SFX 反而最差,聲音的正確性和品質都輸。
木門、玻璃摔破、剪紙這幾題是最考驗的,因為有明確的物理事件,錯了一聽就知道。Medium 在這幾題最像真的。所以如果硬碟夠,只抓 Medium 一個檔,BGM 和音效都用它,Small 兩版可以不用下載。
木門吱呀開然後甩上
玻璃摔破
剪紙與摺紙手作聲
情境推薦
| 你要做的事 | 建議 | 理由 |
|---|---|---|
| 有人聲的歌,中文或英文 | ACE-Step 1.5 Turbo 整合檔 | 曲風最對、最好聽、最快、單一檔案裝完就能用 |
| 同上,顯存充足且在意人聲清晰度 | ACE-Step 1.5 XL Turbo | 音質細節略好,但一般人分不出 |
| 剪片用 BGM、固定長度鋪底 | Stable Audio 3 Medium | 長度精準、幾秒出檔、氣氛比歌曲模型好 |
| 音效、環境音、轉場 | Stable Audio 3 Medium | 唯一能做音效的,且比它自己的 SFX 版更準 |
| 歌詞要逐句貼緊、要乾淨混音、不在意等待 | MiniMax Music 3 | 歌詞跟得最緊,但要接受提前收尾與速度 |
| 傳統民俗舞曲,要能配舞 | 目前沒有推薦 | 三個模型都做成進行曲味道,建議找真實錄音 |
| 最終主打歌 | 留給 Suno 的額度 | 目前開源模型還沒有一個比 Suno 好聽 |
完整對照:17 首歌
每一題三到四個模型並排,同一份歌詞、同一個 seed,各生成一次。播放器不會預先下載,點了才載入。
長安夜雨
鏡花戲
江湖令
採茶謠
Csárdás at Harvest Moon(匈牙利查爾達什)
Kalinka Winter Road(俄羅斯民俗舞曲)
Kolo by the Plum Orchard(巴爾幹 7/8 圓舞)
Hora at the Kibbutz(以色列霍拉)
Hopak of the Steppe(烏克蘭霍帕克,純器樂)
絲路駝鈴(中西融合)
深夜便利店(現代華語流行對照)
HeartMuLa 古典標籤對照
左邊是原本的標籤,右邊加了「傳統古典、宮廷、莊重、不要爵士」之後重跑。
長安夜雨
鏡花戲
江湖令
採茶謠
完整對照:6 段 BGM
Lo-fi 讀書 BGM
輕快 Vlog 開場(烏克麗麗)
紀錄片懸疑鋪底
旅遊 Vlog 溫暖木吉他
古箏氛圍鋪底(茶席/手作影片)
民俗舞曲練習用循環(匈牙利小提琴)
完整對照:12 個音效
雨打窗+遠雷(氛圍)
Prompt:Steady rain hitting a window pane, occasional distant thunder rumble, indoor perspective, no music.
碎石路腳步走近停下
Prompt:Footsteps walking on a gravel path, approaching, then stopping. Single person, outdoor, no music.
木門吱呀開然後甩上
Prompt:Old wooden door creaks open slowly, then slams shut with a heavy thud. Indoor, no music.
轉場 whoosh
Prompt:Fast cinematic whoosh transition sound effect, airy swoosh with a short tail, no music.
UI 點擊與通知 pop
Prompt:Short clean UI click followed by a soft notification pop, modern app interface sound, no music.
咖啡館人聲杯盤氛圍
Prompt:Busy cafe ambience, indistinct chatter, cups and plates clinking, an espresso machine hissing, no music.
貓叫然後呼嚕
Prompt:A cat meows twice then starts purring softly, close-up, quiet room, no music.
煙火升空爆裂
Prompt:Firework rocket whistles up and bursts with crackling sparkles, distant crowd cheering, outdoor night, no music.
機械鍵盤打字
Prompt:Fast typing on a clicky mechanical keyboard, close-up, quiet office, no music.
海浪打卵石灘
Prompt:Gentle ocean waves rolling onto a pebble beach, water draining back through the pebbles, seagulls far away, no music.
剪紙與摺紙手作聲
Prompt:Scissors cutting through thick paper, then paper being folded and creased on a wooden table, close-up, no music.
玻璃摔破
Prompt:A drinking glass falls onto a tile floor and shatters, shards scattering, indoor, no music.
模型下載
全部從 Hugging Face 下載,都是 ComfyUI 可以直接讀的版本。
ACE-Step 1.5:https://huggingface.co/Comfy-Org/ace_step_1.5_ComfyUI_files
| 檔案 | 大小 | 放置位置 |
|---|---|---|
checkpoints/ace_step_1.5_turbo_aio.safetensors(一個檔搞定) | 10.0 GB | models/checkpoints/ |
split_files/diffusion_models/acestep_v1.5_xl_turbo_bf16.safetensors(XL 版才要) | 9.97 GB | models/diffusion_models/ |
split_files/text_encoders/qwen_0.6b_ace15.safetensors 與 qwen_4b_ace15.safetensors(XL 版才要) | 1.19 GB、8.38 GB | models/text_encoders/ |
split_files/vae/ace_1.5_vae.safetensors(XL 版才要) | 0.34 GB | models/vae/ |
Stable Audio 3:https://huggingface.co/Comfy-Org/stable-audio-3
| 檔案 | 大小 | 放置位置 |
|---|---|---|
checkpoints/stable_audio_3_medium.safetensors | 9.22 GB | models/checkpoints/ |
text_encoders/t5gemma_b_b_ul2.safetensors | 1.19 GB | models/text_encoders/ |
Small-SFX 與 Small-Music 各 2.27 GB,同一個 repo,想省硬碟可以只抓其中一個試試,但我的結果是 Medium 更好。
MiniMax Music 3:https://huggingface.co/Comfy-Org/MiniMax-Music-3
| 檔案 | 大小 | 放置位置 |
|---|---|---|
diffusion_models/minimax_music3_dit_fp16.safetensors | 4.91 GB | models/diffusion_models/ |
text_encoders/minimax_music3_text_encoder_pruned_bf16.safetensors(顯存有限可改抓 int8 版) | 16.7 GB | models/text_encoders/ |
vae/minimax_music3_dav.safetensors | 0.22 GB | models/vae/ |
HeartMuLa 3B:需要社群節點 ComfyUI_FL-HeartMuLa,模型會自動下載到 models/heartmula/。它的依賴清單會把幾個常用套件升版,我最後是手動只裝需要的幾個,一般使用者請先備份環境再裝。
相關文章
- 開源歌曲模型評比題目全公開:17 首歌詞、曲風規格與 12 個音效 Prompt — 本文所有題目的歌詞與 prompt 正本
- Suno AI Prompt 產生器 — 我平常寫 Suno 風格描述用的小工具,這次測試的曲風描述也是從這套詞彙出發
- Behind the Song: Waltz of the Shadows — 用 Suno 做的哥德華爾滋,這次評比最早的 smoke test 就是拿它的歌詞去跑


