做一個卡拉 OK 版
最常見的需求:沒有人聲的歌。Demucs 把人聲放到一邊,剩下的鼓、貝斯、其他就是卡拉 OK。三軌放進剪輯,一首歌在上面唱。
一首 30 秒的歌由 Demucs 分成人聲、鼓、貝斯、其他四軌,旁邊是同一首歌經過人聲分離的結果。不用註冊帳號就能看到完整流程。
真實工作流,真實成果。可自由拖曳與縮放。
使用這個工作流真實流程:同一首歌進入兩個增強聲音節點,Demucs 交出四軌,分離只交出一軌。
重點摘要
做卡拉 OK、為混音抽出人聲、把一首歌的鼓抽出來跟著練:都從同一個動作開始,把歌拆成分軌。這個流程用 Meta 的分離模型 Demucs 來做:歌進入增強聲音節點,出來四個檔案,人聲、鼓、貝斯,以及包含吉他和鍵盤在內的其餘全部。
第二個節點刻意做別的事。ElevenLabs Audio Isolation 是為說話設計的,不是為音樂,而示範展示了它對一首歌照樣會做什麼:只交出人聲。2026 年 9 月 3 日在示範曲上量過,它的包絡跟 Demucs 的人聲軌相關 0.93,音量高 17 %。但它只交出這個:沒有伴奏,所以沒有卡拉 OK。
示範的歌是生成的,免得向任何人要授權。你的歌從每個節點的匯入按鈕進來,每次最長十分鐘,價錢按秒算:三十秒跑兩個節點要十四美分,其中 Demucs 佔四點數。
匯入你的歌
MP3、WAV、M4A 或 OGG,最長十分鐘。播放器一讀到長度,節點就顯示長度和價錢。音訊埠也接受在畫布上生成的音樂。
跑 Demucs
一鍵,四個檔案:人聲、鼓、貝斯、其他。每一軌都有自己的播放器和下載鈕,節點的輸出帶著第一軌,人聲。
跟分離比對
第二個節點走另一條路只給人聲。編曲很滿的歌聲,兩者之一會把句尾保得更好:決定送哪一個進剪輯之前,兩個都聽。
組出你的版本
卡拉 OK 就是去掉人聲的三軌:放到[剪輯](/docs/canvas-nodes)的三條音軌上,匯出。要混音就留下人聲,換掉其餘。
同一塊畫布,針對不同需求微調:每個變化版本只要改兩三行提示詞。
最常見的需求:沒有人聲的歌。Demucs 把人聲放到一邊,剩下的鼓、貝斯、其他就是卡拉 OK。三軌放進剪輯,一首歌在上面唱。
反過來:只要人聲,放到新的編曲上。這裡兩個節點在競爭,也正是示範的用意:Demucs 和分離各交出略有不同的人聲,選句尾撐得最住的那個。
想學一首歌的鼓手把鼓軌抽出來循環聽,上面沒有吉他。貝斯也一樣。這是 Demucs 分得最乾淨的兩軌。
在客廳拍的翻唱,人聲和吉他混在一起。從影片抽出音訊、過 Demucs,人聲就能單獨重新混、放大,再放回畫面上。
Demucs 只認得四個家族。要精確抽出一把吉他或一台鋼琴,SAM Audio 節點接受文字描述,「the electric guitar」,把辨認出來的放一邊、其餘放另一邊。
分出來的人聲比混音好聽打得多:歌詞不再跟小鼓打架。先分離,再聽打,留著人聲軌核對可疑的字。
它交出人聲,永遠不會交出相反的。節點叫「分離」,做的正是這件事:不是人聲的被丟掉,不是放到一邊。卡拉 OK 要找 Demucs。
96 kb/s 的 MP3 或從喇叭錄下的歌,已經丟掉了 Demucs 用來辨認樂器的高頻。分軌會糊。從拿得到的最好檔案出發,可能的話用原始檔。
價錢按秒算,Demucs 跑長檔案又慢。先剪到你要的段落,再分離:更便宜、更快,結果一樣。
Demucs 把不是人聲、鼓、貝斯的全部丟進「其他」:吉他、鍵盤、弦樂,一起。要特定樂器,是上面說的 SAM Audio 節點,不是一條不存在的第五軌。
Demucs,只有它。卡拉 OK 是人聲以外的全部,也就是鼓、貝斯和其他三軌合在一起。人聲分離只交出人聲,做不出相反的東西。
耳朵聽是乾淨的,放大鏡下不完美。在和聲和長殘響上,Demucs 偶爾會在人聲軌留下其餘混音的一絲氣息。混音時它會沉在新樂器底下;純清唱的話,聽聽無聲的地方。
技術上可以,模型不讀版權。結果怎麼用取決於那首歌的授權:在家唱的卡拉 OK 沒問題,公開發布就有。示範曲正是為此而生成的。
Demucs 三十秒四點數,一分鐘六點,十分鐘上限約六十點。人聲分離較貴,每分鐘十四點。價錢在點擊前就顯示在節點上,依你檔案量到的長度計算。
兩個節點都是每次十分鐘。整張專輯一首一首處理,反正你要的也是這樣:一首歌一組分軌。
任何軟體都能讀的音訊檔,一軌一個,從節點下載。每一軌長度跟原曲完全一樣,疊起來不會錯位。
做得到。畫布在手機上可用,檔案從節點裡選,包括手機裡的檔案。在手機上創作這篇指南解釋用手指操作畫布的方式。
不會。你上傳的留在你的工作空間,不交給任何訓練。產出的檔案是你的,在原曲授權的範圍內。