Alle Tools

Eine Aufnahme säubern mit KI

Eine Sprachnotiz, auf einer lauten Terrasse diktiert, durch beide Entrauscher des Katalogs nebeneinander, DeepFilterNet 3 und ElevenLabs Audio Isolation. Der vollständige Workflow, ohne Konto.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: dieselbe verrauschte Notiz geht in zwei Nodes „Ton verbessern“, und Sie hören, was jeder entfernt hat.

Auf einen Blick

Was der Workflow liefert
2 bearbeitete Audiodateien
Aufbau des Canvas
3 Nodes, verbunden durch 0 Kabel
Verdrahtete Modelle
DeepFilterNet 3, ElevenLabs Audio Isolation
Kosten eines kompletten Durchlaufs
rund 6 Credits, also 0,06 €

Ein Interview, mit dem Handy im Café aufgenommen, eine Sprachnotiz auf der Straße, eine Podcast-Stimme mit dem Kühlschrank im Hintergrund: das Hintergrundgeräusch trennt eine brauchbare Aufnahme von einer, die man wiederholen muss. Dieser Workflow entfernt es mit den beiden Modellen des Katalogs, die das können, und stellt sie nebeneinander, weil sie nicht gleich arbeiten.

DeepFilterNet 3 ist ein Filter: es entfernt, was keine Stimme ist, und lässt die Luft des Raums stehen, das Ergebnis bleibt natürlich. ElevenLabs Audio Isolation baut die Stimme neu auf: trockener, radiohafter, bei Konsonanten manchmal etwas synthetisch. Bei der Demo-Notiz, absichtlich aus einer sauberen Stimme, Straßenatmosphäre und einem Brummen gemischt, wissen wir genau, was zu entfernen war.

Ihre Datei kommt über den Import-Button des Nodes hinein, bis zu zehn Minuten pro Durchlauf, und der Preis zählt pro Sekunde: beide Säuberungen auf vierzehn Sekunden kosten sechs Cent, und DeepFilterNet allein liegt bei neun Credits pro Minute.

So geht's

  1. 1

    Importieren Sie die Aufnahme

    MP3, WAV, M4A oder OGG, bis zu zehn Minuten. Der Node liest die Dauer und zeigt den Preis vor jedem Klick. Ein anderswo auf der Leinwand erzeugtes Audio lässt sich auch an den Port kabeln.

  2. 2

    Starten Sie den Filter

    DeepFilterNet 3 zuerst: es ist das günstigste und das treueste. Kommt die Stimme klar heraus und der Raum ist noch da, sind Sie fertig.

  3. 3

    Probieren Sie den Neuaufbau

    War das Geräusch laut, oder muss die Stimme auf Musik liegen, starten Sie die Isolierung daneben. Sie kommt trockener heraus, was sich im Schnitt besser mischt.

  4. 4

    Hören Sie auf die Konsonanten

    Dort trennen sich die beiden: die s- und t-Laute sind das, was ein Entrauscher zuerst beschädigt. Die Gewinnerdatei geht in den Schnitt oder wird aus dem Node heruntergeladen.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Ein Interview mit dem Handy

Der Schulfall: zwei Personen im Café, das Handy dazwischen. Der Filter entfernt die Tassen und die Kaffeemaschine, beide Stimmen bleiben, mit der Distanz, die dazugehört. Ein Durchlauf reicht in der Regel.

Eine zu Hause aufgenommene Podcast-Stimme

Der Kühlschrank, die Straße durchs Fenster, der Lüfter des Rechners: ein konstantes, leises Geräusch, das der Filter spurlos entfernt. Bei einer mikrofonnahen Stimme ist DeepFilterNet das Richtige, der Neuaufbau wäre zu viel.

Eine auf der Straße diktierte Notiz

Die Notiz der Demo. Lautes, wechselndes Geräusch, Autos und Passanten. Der Filter lässt einen Teppich stehen, der Neuaufbau löscht ihn: hier gewinnt er, denn man will verstehen, nicht die Atmosphäre behalten.

Eine Stimme für ein Video

Ein ohne Studio gefilmtes Voice-over, das auf Bilder und Musik gelegt wird. Das Ergebnis der Isolierung, trockener, mischt sich im Schnitt besser als eine Stimme, die den Raum noch hinter sich herzieht.

Eine alte Familienaufnahme

Eine digitalisierte Kassette, mit ihrem Rauschen und ihrem Brummen. Der Filter entfernt das Rauschen und lässt die Stimme, wie sie war, und das will man von einer Erinnerung: klar, nicht umgeschrieben.

Ein aus dem Saal aufgenommener Vortrag

Eine ferne Stimme, Hall, Husten. Beide entfernen das Geräusch; keines verkürzt den Hall des Saals, der kein Geräusch ist, sondern Raum. Erwarten Sie eine klare, aber weiterhin ferne Stimme.

Häufige Fehler

Säubern, bevor man schneidet

Der Preis zählt pro Sekunde. Eine Stunde Aufnahme zu säubern, um zehn Minuten zu behalten, kostet sechsmal zu viel. Erst schneiden, dann säubern, auf der Stelle, die Sie behalten.

Beide Verfahren stapeln

Filter und dann Neuaufbau, oder umgekehrt, ergibt keine doppelt so gute Säuberung: das zweite Modell arbeitet auf einer bereits veränderten Stimme und verstärkt deren Artefakte. Ein Durchlauf, nach Gehör gewählt.

Von einer fernen Aufnahme ein Studio erwarten

Ein Entrauscher entfernt, was nicht die Stimme ist; er holt ein Mikrofon, das drei Meter entfernt war, nicht näher heran. Hall und Distanz bleiben. Sie hören dieselbe Stimme, ohne das Geräusch drumherum.

Aus Versehen Musik säubern

Eine Konzertaufnahme durch einen Entrauscher kommt mit der Stimme und ohne die Band heraus: die Instrumente gelten als Geräusch. Für einen Song braucht es die Spurentrennung, nicht die Säuberung.

Empfohlene Modelle

Häufige Fragen

Welches der beiden soll ich wählen?

Fast immer zuerst den Filter: er entfernt das Geräusch, ohne die Stimme umzuschreiben. Den Neuaufbau, wenn das Geräusch lauter war als die Stimme, oder wenn das Ergebnis in Musik aufgehen soll, weil sich ein trockeneres Timbre besser mischt.

Funktioniert es bei Musik?

Nein, und das ist Absicht. Beide Modelle behalten die Stimme und verwerfen den Rest: bei einem Song wird die Musik als Geräusch behandelt. Um einen Song in Spuren zu trennen, erledigt der Workflow Gesang aus einem Song trennen diese Arbeit mit Demucs.

Und wenn zwei Personen sprechen?

Beide Stimmen bleiben, keines der Modelle unterscheidet Sprecher. Was geht, ist das Geräusch zwischen ihnen, nicht eine von ihnen. Um nur eine Stimme zu behalten, beschreibt man SAM Audio, einem anderen Node des Katalogs, was man sucht.

Was kostet eine Säuberung?

DeepFilterNet 3 liegt bei neun Credits pro Minute, die ElevenLabs-Isolierung bei vierzehn. Die Demo-Notiz, vierzehn Sekunden in beiden Nodes, kostet sechs Credits. Der Preis steht vor dem Klick auf dem Node, berechnet auf die gemessene Dauer Ihrer Datei.

Wie lang darf die Datei sein?

Zehn Minuten pro Durchlauf. Eine längere Aufnahme wird im Schnitt in Stücke geteilt oder nur an den Stellen gesäubert, die Sie behalten, was ohnehin günstiger ist.

Verändert die Säuberung die Stimme?

Der Filter nicht: er entfernt, er fügt nichts hinzu. Der Neuaufbau ein wenig: er schreibt die Stimme aus dem Erkannten neu, und bei Zischlauten kann man es hören. Deshalb zeigt die Demo beide.

Kann ich den Ton eines Videos säubern?

Ja, in zwei Schritten: der Schnitt exportiert die Tonspur, der Node säubert sie, und die saubere Stimme legt sich anstelle der alten wieder auf die Bilder.

Werden meine Aufnahmen zum Training von Modellen genutzt?

Nein. Was Sie hochladen, bleibt in Ihrem Bereich und wird keinem Training übergeben, und die Frage zählt hier mehr als anderswo: oft geht es um Interviews und die Stimmen nahestehender Menschen.

Eine Aufnahme säubern mit KI

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.