Alle Tools

Gesang aus einem Song trennen mit KI

Ein 30-Sekunden-Song, von Demucs in vier Spuren getrennt, Gesang, Schlagzeug, Bass und Rest, daneben derselbe Song durch die Stimmisolierung. Der vollständige Workflow, ohne Konto.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: derselbe Song geht in zwei Nodes „Ton verbessern“, Demucs liefert vier Spuren, die Isolierung eine.

Auf einen Blick

Was der Workflow liefert
5 bearbeitete Audiodateien
Aufbau des Canvas
3 Nodes, verbunden durch 0 Kabel
Verdrahtete Modelle
Demucs, ElevenLabs Audio Isolation
Kosten eines kompletten Durchlaufs
rund 12 Credits, also 0,12 €

Ein Karaoke bauen, die Stimme für einen Remix isolieren, das Schlagzeug aus einem Stück holen, um dazu zu spielen: alles beginnt mit demselben Vorgang, einen Song in seine Spuren zu trennen. Dieser Workflow tut es mit Demucs, dem Trennmodell von Meta: der Song geht in einen Node „Ton verbessern“, vier Dateien kommen heraus, der Gesang, das Schlagzeug, der Bass und alles Übrige, Gitarren und Keyboards inklusive.

Der zweite Node tut absichtlich etwas anderes. ElevenLabs Audio Isolation ist für Sprache gebaut, nicht für Musik, und die Demo zeigt, was er trotzdem aus einem Song macht: er liefert die Stimme allein. Gemessen am 3. September 2026 am Demo-Song folgt seine Hüllkurve der Gesangsspur von Demucs mit 0,93 Korrelation, 17 % lauter. Aber mehr liefert er nicht: kein Instrumental, also kein Karaoke.

Der Demo-Song ist generiert, damit niemand um Rechte gefragt werden muss. Ihrer kommt über den Import-Button jedes Nodes hinein, bis zu zehn Minuten pro Durchlauf, und der Preis zählt pro Sekunde: beide Nodes auf dreißig Sekunden kosten zwölf Cent, davon vier Credits für Demucs.

So geht's

  1. 1

    Importieren Sie Ihren Song

    MP3, WAV, M4A oder OGG, bis zu zehn Minuten. Der Node zeigt die Dauer, sobald der Player sie gelesen hat, und den Preis dazu. Der Audio-Port nimmt auch eine auf der Leinwand generierte Musik an.

  2. 2

    Starten Sie Demucs

    Ein Klick, vier Dateien: Gesang, Schlagzeug, Bass, Sonstiges. Jede Spur hat ihren Player und ihren Download-Button, und der Ausgang des Nodes trägt die erste, den Gesang.

  3. 3

    Vergleichen Sie mit der Isolierung

    Der zweite Node liefert die Stimme allein auf einem anderen Weg. Bei stark produziertem Gesang hält der eine oder der andere die Phrasenenden besser: hören Sie beide, bevor Sie entscheiden, welcher in den Schnitt geht.

  4. 4

    Bauen Sie Ihre Version

    Das Karaoke sind die drei Spuren ohne die Stimme: legen Sie sie auf drei Audiospuren des [Schnitts](/docs/canvas-nodes) und exportieren Sie. Für einen Remix behalten Sie die Stimme und ersetzen den Rest.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Eine Karaoke-Version

Der meistgefragte Fall: der Song ohne seine Stimme. Demucs legt den Gesang beiseite, das Karaoke ist, was bleibt, Schlagzeug, Bass und Sonstiges. Drei Spuren für den Schnitt, und ein Song, über den man singt.

Ein A cappella für einen Remix

Das Gegenteil: die Stimme allein, für eine neue Produktion. Hier konkurrieren die beiden Nodes, und das ist der Sinn der Demo: Demucs und die Isolierung liefern je eine etwas andere Stimme, nehmen Sie die, deren Phrasenenden am besten halten.

Zum Schlagzeug eines Stücks spielen

Ein Schlagzeuger, der ein Stück lernt, isoliert die Schlagzeugspur und hört sie in Schleife, ohne die Gitarre darüber. Beim Bass geht es genauso. Das sind die beiden Spuren, die Demucs am saubersten trennt.

Ein mit dem Handy aufgenommenes Cover säubern

Ein im Wohnzimmer gefilmtes Cover hat Stimme und Gitarre vermischt. Audio aus dem Video ziehen, durch Demucs schicken, und die Stimme lässt sich separat neu mischen, lauter, bevor sie zurück auf die Bilder kommt.

Ein einzelnes Instrument isolieren

Demucs kennt nur vier Familien. Um genau eine Gitarre oder ein Klavier herauszuholen, nimmt der Node SAM Audio eine Textbeschreibung, „the electric guitar“, und liefert das Erkannte auf der einen, den Rest auf der anderen Seite.

Einen Song untertiteln oder transkribieren

Eine getrennte Stimme lässt sich viel besser transkribieren als ein Mix: die Wörter kämpfen nicht mehr gegen die Snare. Erst trennen, dann transkribieren, und die Gesangsspur behalten, um ein zweifelhaftes Wort zu prüfen.

Häufige Fehler

Von der Stimmisolierung ein Karaoke verlangen

Sie liefert die Stimme, nie ihr Gegenteil. Der Node heißt „Isolierung“, und genau das tut er: was nicht Stimme ist, wird verworfen, nicht beiseitegelegt. Fürs Karaoke ist Demucs zuständig.

Eine bereits stark komprimierte Datei trennen

Eine MP3 mit 96 kb/s oder ein vom Lautsprecher abgenommener Song hat die Höhen schon verloren, mit denen Demucs Instrumente erkennt. Die Spuren kommen verschwommen heraus. Gehen Sie von der besten verfügbaren Datei aus, wenn möglich vom Original.

Zehn Minuten durchlaufen lassen, um dreißig Sekunden zu behalten

Der Preis zählt pro Sekunde, und Demucs ist bei langen Dateien langsam. Schneiden Sie erst auf die Stelle, die Sie interessiert, dann trennen Sie: billiger, schneller, und das Ergebnis ist dasselbe.

Eine Spur „Gitarre“ erwarten

Demucs legt alles, was weder Stimme, Schlagzeug noch Bass ist, unter „Sonstiges“ ab: Gitarren, Keyboards, Streicher, zusammen. Für ein bestimmtes Instrument ist der oben beschriebene Node SAM Audio zuständig, nicht eine fünfte Spur, die es nicht gibt.

Empfohlene Modelle

Häufige Fragen

Welcher der beiden Nodes macht das Karaoke?

Demucs, und nur er. Das Karaoke ist alles, was nicht die Stimme ist, also die Spuren Schlagzeug, Bass und Sonstiges zusammen. Die Stimmisolierung liefert nur die Stimme, das Gegenteil kann sie nicht erzeugen.

Ist die getrennte Stimme sauber?

Sauber fürs Ohr, nicht perfekt unter der Lupe. Bei Chören und langen Hallfahnen lässt Demucs manchmal einen Hauch des übrigen Mixes in der Gesangsspur. Im Remix geht er unter den neuen Instrumenten unter; für ein nacktes A cappella hören Sie in die Pausen.

Darf ich ein geschütztes Stück trennen?

Technisch ja, das Modell liest keine Rechte. Was Sie mit dem Ergebnis tun, fällt unter die Lizenz des Stücks: ein Karaoke fürs Wohnzimmer wirft keine Frage auf, eine Veröffentlichung schon. Genau deshalb ist der Demo-Song generiert.

Was kostet eine Trennung?

Vier Credits für dreißig Sekunden mit Demucs, sechs pro Minute, rund sechzig für die maximalen zehn Minuten. Die Stimmisolierung ist teurer, vierzehn Credits pro Minute. Der Preis steht vor dem Klick auf dem Node, berechnet auf die gemessene Dauer Ihrer Datei.

Wie lang darf die Datei sein?

Zehn Minuten pro Durchlauf, für beide Nodes. Ein ganzes Album wird Stück für Stück verarbeitet, was ohnehin das ist, was Sie wollen: ein Spurensatz pro Song.

Welches Format kommt heraus?

Audiodateien, die jede Software liest, eine pro Spur, herunterladbar aus dem Node. Jede Spur hat exakt die Dauer des Originalsongs, sie liegen ohne Versatz übereinander.

Geht das vom Handy aus?

Ja, die Leinwand läuft mobil und die Datei wird im Node gewählt, auch aus den Dateien des Handys. Der Leitfaden mobil erstellen erklärt die Gesten der Leinwand mit dem Finger.

Werden meine Dateien zum Training von Modellen genutzt?

Nein. Was Sie hochladen, bleibt in Ihrem Bereich und wird keinem Training übergeben. Die erzeugten Dateien gehören Ihnen, im Rahmen der Rechte am Originalstück.

Gesang aus einem Song trennen mit KI

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.