Den Hörbuch-Ausschnitt eines Buches mit KI erstellen

Das Kapitel als PDF auf den Canvas gezogen: ein Text-Node schreibt dessen Anfang Wort für Wort ab, eine Erzählerstimme von ElevenLabs liest ihn vor, eine instrumentale Klangfläche läuft darunter, und das Cover bleibt in einem 16:9-Montage-Node im Bild: das Video, das online gestellt wird, um das erste Kapitel hörbar zu machen. Der gesamte Workflow ist ohne Konto sichtbar.

Das erste Kapitel des Original-Romans, ein PDF, das in den Media-Node gezogen wirdInteraktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: das erste Kapitel eines Romans als PDF in einem Media-Node, Claude Sonnet 5 schreibt den Anfang ab, ElevenLabs v3 für die Erzählung, ElevenLabs Music für die Klangfläche, GPT Image 2.5 Flare für das Cover, ein Montage-Node. Die angezeigten Texte sind die Antworten der Modelle, unbearbeitet.

Auf einen Blick

Sie stellen bereit
1 PDF · ein Text oder ein Briefing
Was der Workflow liefert
1 Bild in 3:4 · 1 Tonspur, zusammen 60 s · 1 Voice-over
Aufbau des Canvas
8 Nodes, verbunden durch 6 Kabel
Verdrahtete Modelle
Claude Sonnet 5, ElevenLabs v3, ElevenLabs Music, GPT Image 2.5 Flare
Kosten eines kompletten Durchlaufs
rund 97 Credits, also 0,97 €
Konto
Die Demo ist ohne Konto sichtbar; zum Generieren ist ein kostenloses Konto nötig, Test-Credits inklusive

Das erste Kapitel hörbar zu machen ist die beste Werbung für ein Buch. Das PDF gelangt in einen Media-Node, und ein Text-Node liest es über seinen Anschluss „Bild oder PDF zur Analyse" aus, um den Anfang Wort für Wort abzuschreiben, ohne etwas umzuschreiben, bis zum Ende eines Absatzes vor 1.400 Zeichen: der Länge einer anderthalbminütigen Lesung.

Der Voice-over-Node liest diesen verkabelten Text mit ElevenLabs v3 vor, einer aus der Liste gewählten Erzählerstimme. Der Musik-Node komponiert sechzig Sekunden instrumentale Klangfläche nach einem verkabelten Brief, im Montage-Node bei niedriger Lautstärke in Schleife gelegt. Der Bild-Node zeichnet das Cover mit dem Titel auf GPT Image 2.5 Flare, und der Montage-Node zeigt es ganz, auf schwarzem Grund, für die Dauer der Erzählung.

Die Demo liest den Anfang von „North of Silence", einem für das Beispiel geschriebenen Original-Roman. Ersetzen Sie das PDF durch Ihr Kapitel, die Stimme im Node, den Titel im Cover-Prompt. Ein ganzes Kapitel wird in mehreren Voice-over-Nodes zu je 3.000 Zeichen gelesen, im Montage-Node aneinandergereiht. Das Cover und der Trailer ergänzen die Reihe.

Tatsächliche Ergebnisse aus der Demo

Das sind die Dateien des obigen Workflows, genau so, wie die Modelle sie erzeugt haben, ohne Nachbearbeitung. Der Ausgangspunkt wird angezeigt, sofern es einen gibt.

Ergebnis

Die Erzählung des Kapitelanfangs, gelesen von ElevenLabs v3 mit der Stimme GeorgeErstellt mit ElevenLabs v3
Die sechzigsekündige instrumentale Klangfläche, komponiert von ElevenLabs Music, in Schleife unter der StimmeErstellt mit ElevenLabs Music
Das Cover mit dem Titel, gezeichnet von GPT Image 2.5 Flare, ganz im Montage-Node gezeigtErstellt mit GPT Image 2.5 Flare
Der fertig geschnittene Ausschnitt: das Cover im Bild, die Erzählung und die Klangfläche, bereit zur Veröffentlichung

Für wen

Autoren und Verlage, die ein erstes Kapitel ohne Studio oder Schauspieler hörbar machen oder eine Stimme vor einem vollständigen Hörbuch testen möchten.

Welche Dateien bereitzustellen sind

Ein Kapitel als Text-PDF, kein Scan: Der Text-Node schreibt die Prosa unverändert ab, und die Stimme liest sie Satz für Satz.

So geht's

  1. 1

    Ziehen Sie das Kapitel als PDF hinein

    Ein Media-Node empfängt es. Der Text-Node schreibt den Anfang ab, keine Zusammenfassung: Es ist Ihre Prosa, die gelesen wird, Satz für Satz, bis zum Ende eines Absatzes.

  2. 2

    Wählen Sie die Stimme und lesen Sie vor

    Der Voice-over-Node empfängt den Text per Kabel. Rund zwanzig ElevenLabs v3-Stimmen, oder eine geklonte Stimme: Die Demo verwendet George, einen ruhigen Erzähler. Ein Tag [pause] oder [whispers] im Text steuert den Vortrag.

  3. 3

    Komponieren Sie die Klangfläche und zeichnen Sie das Cover

    Der Musik-Node komponiert sechzig Sekunden nach dem verkabelten Brief, instrumental. Der Bild-Node schreibt den Titel in das Cover im Format 3:4, zwei Credits. Beide lassen sich neu erzeugen, ohne die Erzählung zu berühren.

  4. 4

    Schneiden und veröffentlichen

    Der Montage-Node legt das ganze Cover auf schwarzem Grund im Format 16:9 an, die Erzählung auf einer Spur, die in Schleife gelegte Klangfläche bei niedriger Lautstärke auf der anderen, mit einem finalen Fade. Rendering im Browser, ohne Credits, Export als mp4.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Der Ausschnitt des ersten Kapitels

Das ist die Demo: der Wort für Wort abgeschriebene Anfang, eine Erzählerstimme, eine Klangfläche, das Cover im Bild. Ersetzen Sie das PDF und den Titel, behalten Sie den Rest, und das Video entsteht für Ihr Buch neu.

Das vollständige Kapitel in mehreren Durchgängen

Ein Text-Node pro 3.000-Zeichen-Abschnitt, jeweils ein Voice-over-Node, alle im selben Montage-Node: Ein fünfzehnminütiges Kapitel wird in rund zehn Nodes gelesen, die Klangfläche darunter in Schleife.

Der vom Autor gelesene Ausschnitt

Klonen Sie Ihre Stimme in einem Voice-over-Node aus einer Minute Aufnahme, und wählen Sie sie dann für die Erzählung: Das erste Kapitel wird von Ihnen selbst gelesen, ohne Studio.

Die Podcast-Version, ohne Bild

Entfernen Sie den Bild-Node und den Montage-Node: Die Erzählung und die Klangfläche werden aus den Nodes als mp3 exportiert, für eine Podcast-Plattform oder die Seite des Buches.

Der Ausschnitt in mehreren Sprachen

Bitten Sie den Text-Node, den Abschnitt zu übersetzen, stellen Sie die Sprache des Voice-over-Nodes ein, behalten Sie das Cover: Dasselbe Video existiert auf Englisch, Spanisch, Deutsch, mit derselben Stimme.

Häufige Fehler

Eine Zusammenfassung statt des Textes

Die Anweisung lautet, die Prosa genau abzuschreiben. Fasst das Modell zusammen, hat es ein gescanntes PDF ohne Text gelesen: Wandeln Sie das Manuskript in ein Text-PDF um, nicht in Seitenbilder.

Eine Klangfläche, die die Stimme übertönt

Die Musik liegt im Montage-Node bei 0,25, um unter der Erzählung zu bleiben. Eine Klangfläche mit ausgeprägter Melodie zieht das Ohr an sich: Bitten Sie im Brief um einen Hintergrund ohne Thema, ohne Percussion.

Das zugeschnittene Cover

Der Montage-Node ist so eingestellt, dass das ganze Bild auf schwarzem Grund enthalten ist. Im Modus „Füllen" verliert ein 3:4-Cover seinen Titel oben und unten: Behalten Sie für einen Ausschnitt den Modus „Einpassen".

Empfohlene Modelle

Häufige Fragen

Kann man ein ganzes Kapitel vorlesen?

Ja, in Abschnitten: Ein Voice-over-Node liest bis zu 3.000 Zeichen. Bitten Sie den Text-Node um den nächsten Abschnitt, duplizieren Sie den Voice-over-Node und legen Sie die Abschnitte im Montage-Node aneinander. Der Preis richtet sich nach den gelesenen Zeichen.

Wie viel kostet der Ausschnitt?

Rund sechzig Credits für die Demo: die Erzählung mit 1.400 Zeichen (rund zwölf Credits), die sechzigsekündige Klangfläche (rund fünfzig), das Cover (zwei) und das Auslesen des PDFs (zwei bis drei). Der Preis wird bei jedem Node vor dem Klick angezeigt.

Beachtet die Stimme die Zeichensetzung?

Ja: ElevenLabs v3 markiert Kommas, Punkte und durch eine Leerzeile getrennte Absätze. Für eine längere Pause der Tag [pause], für ein Flüstern [whispers]. Die Tags werden nicht vorgelesen.

Wie lang sollte ein Ausschnitt sein?

Anderthalb bis zwei Minuten, also 1.400 bis 1.800 Zeichen: genug, um eine Stimme und eine Szene zu etablieren, kurz genug, um auf einem Handy vollständig gehört zu werden.

Kann man die Stimme nachträglich ändern?

Ja, am Voice-over-Node, ohne den Text neu zu erzeugen: Wählen Sie einen anderen Klang und starten Sie die Lesung erneut, der Montage-Node aktualisiert sich.

Braucht man ein Cover?

Nein, für den Montage-Node reicht ein beliebiger Bild-Clip: ein Foto des Autors, eine Illustration des Schauplatzes. Das Cover mit dem Titel bleibt aber das, was sich am besten teilen lässt.

Wo veröffentlicht man das Video?

Auf der Seite des Buches, in sozialen Netzwerken, als Episode null eines Podcasts: Das mp4 kommt im Format 16:9, 1080p, mit abgemischtem Ton heraus. Ein Montage-Node im Format 9:16 erstellt die vertikale Version.

Den Hörbuch-Ausschnitt eines Buches mit KI erstellen

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.