Alle Tools

KI-Voice-over: derselbe Text, gelesen von drei Engines

Dasselbe Skript, gelesen von drei Sprachsynthese-Engines, ElevenLabs v3, MiniMax Speech 2.8 HD und OpenAI TTS HD, um das Voice-over nach Gehör zu wählen. Der vollständige Workflow, ohne Konto.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: ein Text-Node trägt das Skript, drei Voice-over-Nodes lesen es je mit ihrer Engine, und Sie hören zu.

Auf einen Blick

Was der Workflow liefert
3 Voice-overs
Aufbau des Canvas
5 Nodes, verbunden durch 3 Kabel
Verdrahtete Modelle
ElevenLabs v3, MiniMax Speech 2.8 HD, OpenAI TTS HD
Kosten eines kompletten Durchlaufs
rund 17 Credits, also 0,17 €

Ein Voice-over für ein Video, ein vorgelesener Text für ein Tutorial, eine Erzählstimme für einen Podcast: die Frage lautet nie „kann man eine Stimme generieren“, sondern „welche“. Dieser Workflow antwortet nach Gehör. Das Skript lebt in einem Text-Node und erreicht drei Voice-over-Nodes per Kabel, jeder mit einer anderen Engine: einen Satz ändern, neu starten, alle drei lesen neu.

Die drei stehen nicht zufällig da. ElevenLabs v3 ist die ausdrucksstärkste, sie spielt Kommas und Punkte aus, und die teuerste. MiniMax Speech 2.8 HD ist die natürlichste, mit leichtem Akzent bei manchen Eigennamen. OpenAI TTS HD ist die Standard-Engine des Nodes, gleichmäßig, halb so teuer. Jeder Node bietet eigene Stimmen, ein eigenes Tempo und bei ElevenLabs Spielanweisungen.

Das Demo-Skript dauert rund fünfzehn Sekunden, mit Komma, Aufzählung und einem schwierigen Wort, genug, um die Prosodie jeder Engine zu hören. Die drei Lesungen kosten siebzehn Cent; der Node liest den Text in den vierzehn Sprachen der Seite.

So geht's

  1. 1

    Schreiben Sie das Skript in den Text-Node

    Sorgfältige Zeichensetzung macht die halbe Arbeit: Engines atmen an Kommas und senken die Stimme an Punkten. Schreiben Sie Zahlen in Worten, wenn die Lesung exakt sein muss.

  2. 2

    Starten Sie die drei Lesungen

    „Alles generieren“ startet die drei Nodes auf einmal. Jeder Node zeigt seinen Preis vor dem Klick, berechnet auf die Länge des Textes.

  3. 3

    Hören Sie dieselbe Stelle

    Vergleichen Sie am schwierigsten Satz, dem mit dem Eigennamen oder der Aufzählung. Dort trennen sich die Engines, nicht am ersten Satz.

  4. 4

    Wechseln Sie die Stimme, nicht die Engine

    Jede Engine hat mehrere Stimmen, und eine unpassende Stimme verurteilt die Engine nicht. Probieren Sie zwei oder drei im selben Node, bevor Sie wechseln.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Ein Voice-over für ein YouTube-Video

Das Skript eines Zehn-Minuten-Videos, in einem Zug gelesen. MiniMax hält die Länge, ohne das Ohr zu ermüden; ElevenLabs ist lebendiger, aber über zehn Minuten teurer. Der Workflow YouTube-Video ohne Gesicht übernimmt mit den Bildern.

Ein Werbespot von zwanzig Sekunden

Zwanzig Sekunden, in denen jedes Wort zählt: das Terrain von ElevenLabs v3, die Spielanweisungen im Text annimmt, ein Lachen, ein Atmen, ein Flüstern. Der Workflow Kino-Werbespot zeigt die Stimme auf den Bildern.

Ein vorgelesener Text zum Lernen

Eine Lektion, ein Artikel, ein Kapitel zum Hören beim Gehen. Die Standard-Engine reicht und kostet am wenigsten: Gleichmäßigkeit ist eine Qualität, wenn man eine Stunde zuhört.

Dieselbe Stimme in mehreren Sprachen

Ein Tutorial auf Deutsch, Spanisch und Japanisch mit derselben Stimme: ElevenLabs und MiniMax behalten das Timbre von einer Sprache zur nächsten. Der Node liest die Sprache des Textes, Sie übersetzen nur das Skript.

Ein Dialog mit zwei Stimmen

Zwei Figuren, die einander antworten: der Voice-over-Node bietet bei ElevenLabs einen Dialogmodus, eine Stimme pro Zeile. Der Workflow sprechender Avatar geht weiter, mit einem Gesicht, das spricht.

Eine Stimme für Anrufbeantworter oder Führung

Eine Begrüßung, eine Ladendurchsage, ein Museums-Audioguide: kurze Texte, hunderte Male gelesen. Der Preis pro Lesung entscheidet, und die Standard-Engine gewinnt.

Häufige Fehler

Nach dem ersten Satz urteilen

Jede Engine liest einen einfachen Satz gut. Die Unterschiede zeigen sich am Eigennamen, an der Zahl, an der Aufzählung und am langen Satz. Deshalb enthält das Demo-Skript je eines davon.

Fürs Auge schreiben, nicht fürs Ohr

Ein zum Lesen geschriebener Text liest sich laut schlecht: zu lange Sätze, Klammern, Abkürzungen. Sagen Sie ihn sich vor, bevor Sie ihn der Engine geben, und teilen Sie die Sätze.

Zahlen als Ziffern stehen lassen

„1.500 € im Jahr 2024“ wird je nach Engine auf drei Arten gelesen. Schreiben Sie „tausendfünfhundert Euro im Jahr zweitausendvierundzwanzig“ und alle drei lesen dasselbe.

Die Engine wechseln, bevor man die Stimme wechselt

Jede Engine hat viele Stimmen. Eine zu tiefe oder zu schnelle Stimme ist nicht die Engine, sondern die Einstellung: probieren Sie zwei Stimmen und das Tempo, bevor Sie urteilen.

Empfohlene Modelle

Häufige Fragen

Welche der drei soll ich nehmen?

ElevenLabs v3 für einen gespielten Text, Werbung, Fiktion, alles, was Absicht braucht. MiniMax für eine natürliche, lange Erzählung, Dokumentation oder Tutorial. OpenAI für Volumen: Dutzende gleichmäßige Lesungen zum kleinen Preis.

Kann ich meine eigene Stimme verwenden?

Nicht in diesem Workflow, der die Stimmen der Engines vergleicht. Der Voice-over-Node nimmt bei manchen Engines eine Referenzstimme an; das ist eine andere Seite und eine andere Frage, die nach der Einwilligung.

In welchen Sprachen funktioniert es?

In den vierzehn Sprachen der Seite bei ElevenLabs und MiniMax, darunter Japanisch, Arabisch und Hebräisch. OpenAI liest auch die meisten davon, mit stärkerem Akzent außerhalb des Englischen. Der Node wählt die Sprache des Textes.

Was kostet ein Voice-over?

Das Demo-Skript, zweihundertdreißig Zeichen, kostet sieben Credits bei ElevenLabs, sieben bei MiniMax und drei bei OpenAI, siebzehn für alle drei. Der Preis folgt der Textlänge und steht vor dem Klick auf jedem Node.

Wie lang darf der Text sein?

Mehrere tausend Zeichen pro Node, die genaue Grenze hängt von der Engine ab und steht im Node. Ein langer Text wird in Absätze geteilt, ein Node pro Absatz, was auch erlaubt, nur den korrigierten neu zu starten.

Kann ich Emotion oder Tempo einstellen?

Das Tempo bei allen dreien. Die Emotion bei MiniMax über eine Einstellung des Nodes, bei ElevenLabs v3 über Anweisungen im Text selbst, in eckigen Klammern. OpenAI liest, wie es dasteht.

Geht das vom Handy aus?

Ja, die Leinwand läuft mobil und der Text wird direkt im Node geschrieben. Der Leitfaden mobil erstellen erklärt die Gesten der Leinwand mit dem Finger.

Darf ich die Datei frei verwenden?

Ja, die generierte Stimme gehört Ihnen, für ein öffentliches Video wie für kommerzielle Nutzung. Die Stimmen der Engines sind lizenzierte synthetische Stimmen, keine realen Personen.

KI-Voice-over: derselbe Text, gelesen von drei Engines

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.