Ein Satz, von einer Männerstimme gesprochen, von ElevenLabs Voice Changer in drei Stimmen wiedergegeben, eine Frau, ein junger Mann, ein älterer Mann, mit Rhythmus und Betonung des Originals. Der vollständige Workflow, ohne Konto.
Interaktive Demo
Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.
Der echte Workflow: derselbe Satz geht in drei Nodes „Ton verbessern“, jeder auf eine Zielstimme eingestellt, und Sie hören, was sich ändert und was bleibt.
Auf einen Blick
Was der Workflow liefert
3 bearbeitete Audiodateien
Aufbau des Canvas
4 Nodes, verbunden durch 0 Kabel
Verdrahtete Modelle
ElevenLabs Voice Changer
Kosten eines kompletten Durchlaufs
rund 27 Credits, also 0,27 €
Eine Figur, die man synchronisieren will, wenn nur eine Stimme zur Hand ist, ein Voice-over, das tiefer oder jünger klingen soll, eine Sprachnachricht, die anonym werden soll: der Voice Changer macht all das aus einer gewöhnlichen Aufnahme. Dieser Workflow schickt sie durch ElevenLabs Voice Changer mit drei Zielstimmen nebeneinander, um auf einmal zu hören, was er ändert und was er behält.
Was er behält, ist das Wesentliche: den Rhythmus, die Pausen, das Zögern, die Betonung. Der Changer schreibt den Satz nicht um, er gibt ihn mit einer anderen Klangfarbe wieder. Der Demo-Satz hat eine Frage, eine Pause und eine Pointe, und die drei Stimmen geben sie identisch wieder. Das ist keine Sprachsynthese: es ist Ihr Spiel, in einer anderen Kehle.
Einundzwanzig ElevenLabs-Stimmen zur Wahl, und keine eigene Stimme: das Werkzeug verkleidet, es klont nicht. Ihre Datei kommt über den Import-Button des Nodes hinein, bis zu zehn Minuten pro Durchlauf, sekundengenau: der Zwölf-Sekunden-Satz in drei Stimmen kostet siebenundzwanzig Cent, neun Credits pro Stimme.
So geht's
1
Nehmen Sie den Satz auf oder importieren Sie ihn
Eine Sprachnotiz vom Handy reicht. Sprechen Sie so, wie es gesprochen werden soll: der Changer kopiert das Spiel, nicht die Wörter. Eine saubere Aufnahme gibt ein sauberes Ergebnis; ein lauter Hintergrund wird vorher gesäubert.
2
Wählen Sie eine Zielstimme
Einundzwanzig Stimmen, Frauen und Männer, jung und alt, im Wähler des Nodes. Jeder Node trägt seine eigene: drei Nodes auf derselben Quelle, drei Kandidatinnen zum Vergleichen.
3
Hören Sie auf den Rhythmus, nicht auf die Klangfarbe
Die Klangfarbe wird die der gewählten Stimme sein, das steht fest. Beurteilt wird die Treue des Spiels: ist die Pause vor der Pointe noch da, steigt die Frage noch an?
4
In den Schnitt schicken oder herunterladen
Der Ausgang des Nodes lässt sich in den Schnitt oder in eine weitere Bearbeitung kabeln. Für eine Synchronisation eine Stimme pro Figur, jede in ihrem Node.
Varianten und Anwendungsfälle
Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.
Mehrere Figuren allein synchronisieren
Eine Erzählung mit drei Stimmen, ein Dialog, ein Fiktions-Podcast: Sie spielen alle Repliken, eine Zielstimme pro Figur, ein Node pro Figur. Das Spiel ist überall Ihres, nur die Klangfarbe unterscheidet die Rollen.
Eine Aussage anonymisieren
Eine Aussage, die man verbreiten will, ohne dass die Person erkannt wird. Die Stimme ändert sich vollständig, Emotion und Rhythmus bleiben: ehrlicher als eine verlangsamte oder verzerrte Stimme, und viel besser anzuhören.
Ein tieferes oder ruhigeres Voice-over
Ihre Stimme klingt Ihnen zu jung oder zu hoch für eine Erzählung: geben Sie sie mit George oder Roger wieder. Sie behalten Ihre Diktion und Ihre Pausen und gewinnen die Klangfarbe, die Sie nicht haben.
Eine verkleidete Sprachnachricht als Scherz
Der leichteste Fall, und der häufigste. Eine Geburtstagsnachricht, gesprochen von einer Kinder- oder Greisenstimme, mit Ihren Worten und Ihrem Lachen. Sagen Sie dazu, dass es ein Spiel ist: die Stimme überzeugt.
Eine Assistenten- oder Maskottchenstimme
Eine Markenfigur, die in Videos spricht: nehmen Sie die Sätze selbst auf, schicken Sie sie immer durch dieselbe Zielstimme, und die Figur behält ihre Stimme von Video zu Video.
Derselbe Text, von einer Maschine gelesen
Wenn Sie gar keine Aufnahme haben, brauchen Sie den Workflow Voice-over: er erzeugt die Lesung aus dem Text. Der Changer geht immer von einer menschlichen Stimme aus.
Häufige Fehler
Einen Klon erwarten
Der Changer reproduziert keine Stimme, die man ihm als Beispiel gibt. Einundzwanzig Stimmen, alle von ElevenLabs lizenziert, keine reale Person. „Die Stimme von“ jemandem zu wollen liegt außerhalb dessen, was das Werkzeug tut, und außerhalb dessen, was es tun sollte.
Eine Stimme über lautem Hintergrund ändern
Das Geräusch wird nicht verwandelt, es bleibt unverändert unter einer Stimme, die sich geändert hat: der Kontrast macht es hörbarer als zuvor. Erst säubern, dann ändern.
Flach sprechen und auf die Zielstimme zählen
Der Changer spielt nicht für Sie: eine monotone Lesung ergibt eine monotone Zielstimme. Das ganze Spiel muss in der Ausgangsaufnahme stecken, sie gibt den Ton an.
Ein Lied durchschicken
Der Changer ist für Sprache gemacht. Bei Gesang hält er manchmal den Ton, oft nicht, und die Musik dahinter kommt beschädigt heraus. Für ein Lied braucht es zuerst die Spurentrennung.
Nein, und das ist Absicht. Der Changer gibt Ihre Aufnahme mit einer der lizenzierten ElevenLabs-Stimmen wieder; er lernt keine neue Stimme und reproduziert die keiner realen Person. Zum Verkleiden ja; zum Nachahmen von jemandem nein.
Behält die Stimme meinen Akzent?
Sie behält Ihre Aussprache und Ihre Betonung, also weitgehend Ihren Akzent: der Changer rührt die Art, wie Wörter gesagt werden, nicht an, nur die Klangfarbe. Ein starker Akzent bleibt stark, in einer anderen Stimme.
Und wenn die Aufnahme verrauscht ist?
Das Geräusch geht in die neue Stimme über und fällt noch mehr auf, weil die Klangfarbe sich geändert hat und es nicht. Erst mit dem Workflow eine Aufnahme säubern säubern, dann die Stimme ändern.
Was kostet eine Stimmänderung?
Zweiundvierzig Credits pro Minute, sekundengenau. Der Demo-Satz, zwölf Sekunden in drei Nodes, kostet siebenundzwanzig Credits, neun pro Stimme. Der Preis steht vor dem Klick auf dem Node, berechnet auf die gemessene Dauer Ihrer Datei.
Wie lang darf die Aufnahme sein?
Zehn Minuten pro Durchlauf. Eine lange Aufnahme wird im Schnitt in Stücke geteilt, was auch erlaubt, nur die korrigierte Stelle neu zu starten.
In welchen Sprachen funktioniert es?
In allen: der Changer versteht keine Wörter, er verwandelt Klang. Ein Satz auf Japanisch oder Arabisch kommt auf Japanisch oder Arabisch heraus, mit derselben Aussprache.
Geht das vom Handy aus?
Ja, und das ist sogar der natürliche Fall: eine Sprachnotiz, auf dem Handy aufgenommen, von der mobilen Leinwand aus in den Node importiert. Der Leitfaden mobil erstellen erklärt die Gesten.
Werden meine Aufnahmen zum Training von Modellen genutzt?
Nein. Was Sie hochladen, bleibt in Ihrem Bereich und wird keinem Training übergeben, und aus Ihren Dateien wird keine Stimme gelernt: der Changer hat nur seine einundzwanzig Stimmen.