所有工具

用 AI 把人聲從歌曲裡分出來

一首 30 秒的歌由 Demucs 分成人聲、鼓、貝斯、其他四軌,旁邊是同一首歌經過人聲分離的結果。不用註冊帳號就能看到完整流程。

互動示範

真實工作流,真實成果。可自由拖曳與縮放。

使用這個工作流

真實流程:同一首歌進入兩個增強聲音節點,Demucs 交出四軌,分離只交出一軌。

重點摘要

這個工作流會產出什麼
5 個處理後的音訊檔
畫布結構
3 個節點,以 0 條連線相接
已接好的模型
Demucs, ElevenLabs Audio Isolation
跑完一輪的費用
約 12 點數,即 US$0.14

做卡拉 OK、為混音抽出人聲、把一首歌的鼓抽出來跟著練:都從同一個動作開始,把歌拆成分軌。這個流程用 Meta 的分離模型 Demucs 來做:歌進入增強聲音節點,出來四個檔案,人聲、鼓、貝斯,以及包含吉他和鍵盤在內的其餘全部。

第二個節點刻意做別的事。ElevenLabs Audio Isolation 是為說話設計的,不是為音樂,而示範展示了它對一首歌照樣會做什麼:只交出人聲。2026 年 9 月 3 日在示範曲上量過,它的包絡跟 Demucs 的人聲軌相關 0.93,音量高 17 %。但它只交出這個:沒有伴奏,所以沒有卡拉 OK。

示範的歌是生成的,免得向任何人要授權。你的歌從每個節點的匯入按鈕進來,每次最長十分鐘,價錢按秒算:三十秒跑兩個節點要十四美分,其中 Demucs 佔四點數。

操作步驟

  1. 1

    匯入你的歌

    MP3、WAV、M4A 或 OGG,最長十分鐘。播放器一讀到長度,節點就顯示長度和價錢。音訊埠也接受在畫布上生成的音樂。

  2. 2

    跑 Demucs

    一鍵,四個檔案:人聲、鼓、貝斯、其他。每一軌都有自己的播放器和下載鈕,節點的輸出帶著第一軌,人聲。

  3. 3

    跟分離比對

    第二個節點走另一條路只給人聲。編曲很滿的歌聲,兩者之一會把句尾保得更好:決定送哪一個進剪輯之前,兩個都聽。

  4. 4

    組出你的版本

    卡拉 OK 就是去掉人聲的三軌:放到[剪輯](/docs/canvas-nodes)的三條音軌上,匯出。要混音就留下人聲,換掉其餘。

變化版本與使用情境

同一塊畫布,針對不同需求微調:每個變化版本只要改兩三行提示詞。

做一個卡拉 OK 版

最常見的需求:沒有人聲的歌。Demucs 把人聲放到一邊,剩下的鼓、貝斯、其他就是卡拉 OK。三軌放進剪輯,一首歌在上面唱。

給混音用的清唱

反過來:只要人聲,放到新的編曲上。這裡兩個節點在競爭,也正是示範的用意:Demucs 和分離各交出略有不同的人聲,選句尾撐得最住的那個。

跟著一首歌的鼓練

想學一首歌的鼓手把鼓軌抽出來循環聽,上面沒有吉他。貝斯也一樣。這是 Demucs 分得最乾淨的兩軌。

整理用手機錄的翻唱

在客廳拍的翻唱,人聲和吉他混在一起。從影片抽出音訊、過 Demucs,人聲就能單獨重新混、放大,再放回畫面上。

只抽一種樂器

Demucs 只認得四個家族。要精確抽出一把吉他或一台鋼琴,SAM Audio 節點接受文字描述,「the electric guitar」,把辨認出來的放一邊、其餘放另一邊。

為歌曲上字幕或聽打

分出來的人聲比混音好聽打得多:歌詞不再跟小鼓打架。先分離,再聽打,留著人聲軌核對可疑的字。

常見錯誤

向人聲分離要卡拉 OK

它交出人聲,永遠不會交出相反的。節點叫「分離」,做的正是這件事:不是人聲的被丟掉,不是放到一邊。卡拉 OK 要找 Demucs。

拆一個已經壓得很扁的檔案

96 kb/s 的 MP3 或從喇叭錄下的歌,已經丟掉了 Demucs 用來辨認樂器的高頻。分軌會糊。從拿得到的最好檔案出發,可能的話用原始檔。

為了留三十秒跑十分鐘

價錢按秒算,Demucs 跑長檔案又慢。先剪到你要的段落,再分離:更便宜、更快,結果一樣。

期待有一軌「吉他」

Demucs 把不是人聲、鼓、貝斯的全部丟進「其他」:吉他、鍵盤、弦樂,一起。要特定樂器,是上面說的 SAM Audio 節點,不是一條不存在的第五軌。

推薦模型

常見問題

兩個節點裡哪個做卡拉 OK?

Demucs,只有它。卡拉 OK 是人聲以外的全部,也就是鼓、貝斯和其他三軌合在一起。人聲分離只交出人聲,做不出相反的東西。

分出來的人聲乾淨嗎?

耳朵聽是乾淨的,放大鏡下不完美。在和聲和長殘響上,Demucs 偶爾會在人聲軌留下其餘混音的一絲氣息。混音時它會沉在新樂器底下;純清唱的話,聽聽無聲的地方。

可以拆有版權的歌嗎?

技術上可以,模型不讀版權。結果怎麼用取決於那首歌的授權:在家唱的卡拉 OK 沒問題,公開發布就有。示範曲正是為此而生成的。

分離一次多少錢?

Demucs 三十秒四點數,一分鐘六點,十分鐘上限約六十點。人聲分離較貴,每分鐘十四點。價錢在點擊前就顯示在節點上,依你檔案量到的長度計算。

最長可以多久?

兩個節點都是每次十分鐘。整張專輯一首一首處理,反正你要的也是這樣:一首歌一組分軌。

輸出是什麼格式?

任何軟體都能讀的音訊檔,一軌一個,從節點下載。每一軌長度跟原曲完全一樣,疊起來不會錯位。

在手機上做得到嗎?

做得到。畫布在手機上可用,檔案從節點裡選,包括手機裡的檔案。在手機上創作這篇指南解釋用手指操作畫布的方式。

我的檔案會被拿去訓練模型嗎?

不會。你上傳的留在你的工作空間,不交給任何訓練。產出的檔案是你的,在原曲授權的範圍內。

用 AI 把人聲從歌曲裡分出來

使用這個工作流

免費帳號,免綁信用卡。工作流會預先填好,直接在您的畫布中開啟。