24. September 2026
Eine Audioserie mit KI erstellen: von der Idee zur gemischten Episode (Leitfaden 2026)
Bibel, Schreiben mit Gedächtnis, Stimmen, Geräusche, Atmosphären, Musik und Mixing: die vollständige Methode, um mit KI ein Hörspiel zu produzieren, mit Kosten anhand einer echten Pilotepisode.

Frank HoubreGründer von Imaginode
Warum alle Welt auf Audioserien umsteigt
Audioserien mit kurzen Episoden und Cliffhanger-Enden sind zu einem Massenformat geworden, und die KI hat ihre Produktion gerade für eine einzelne Person zugänglich gemacht.
Man hört sie in öffentlichen Verkehrsmitteln, beim Kochen, beim Laufen: Fiktion, aufgeteilt in wenige Minuten lange Episoden, gespielt von mehreren Stimmen, mit Geräuschen und Musik, die die Stimmung setzen. Apps wie Pocket FM geben für dieses Format allein mehr als 250 Millionen Hörer an, und das Publikum reicht weit über Podcast-Fans hinaus.
Bisher brauchte man für eine Serie ein Team: einen Autor für die Staffel, Sprecher für jede Figur, ein Studio zur Aufnahme, einen Tontechniker für Geräusche, Musik und Mischung. Wochenlange Arbeit und ein Budget, das die meisten Autoren abschreckte.
2026 hat jedes Glied dieser Kette sein KI-Äquivalent: Sprachmodelle, die schreiben und sich an eine ganze Staffel erinnern, synthetische Stimmen, die einen Dialog spielen können, Generatoren für Geräusche und Musik. Dieser Leitfaden zeigt, wie man das Schritt für Schritt zusammensetzt, mit den echten Zahlen einer Pilotepisode, die im Drama Studio von Imaginode produziert wurde.
Die fünf Bausteine einer Audioserie
Eine Audioserie beruht auf fünf Bausteinen: einer Bibel, Skripten, Stimmen, Sound und einem Mix. Fehlt einer davon, fällt es sofort auf.
Die Bibel ist das Referenzdokument der Serie: wer die Figuren sind, was sie wollen, wie sie sprechen, wo die Geschichte spielt, welche Handlungsstränge sie öffnet und wie sie diese schließt. Ohne Bibel widerspricht Episode 4 der Episode 2.
Die Skripte sind die Episoden selbst, fürs Ohr geschrieben: Repliken, einige Einwürfe eines Erzählers, Geräusch- und Musikhinweise. Die Stimmen spielen diese Repliken, eine Stimme pro Figur, wiedererkennbar von Episode zu Episode.
Der Sound umfasst drei Ebenen: punktuelle Geräusche (eine Tür, ein Telefon), die durchgehenden Atmosphären jedes Ortes (ein Bahnhof, ein Wald bei Nacht) und die Musik. Der Mix schließlich legt alles auf eine Zeitlinie, senkt die Musik unter die Stimmen und stellt den Pegel so ein, dass eine Episode auf derselben Lautstärke läuft wie jeder andere Podcast.
Schritt 1: eine Idee in eine Serienbibel verwandeln
Zwei Sätze Idee reichen für eine vollständige Bibel, sofern Sie Genre, Episodenlänge und Staffelgröße festlegen.
Nehmen wir die Idee, die als Pilot diente: „Eine Zugbegleiterin des letzten Nachtzugs Paris Nizza entdeckt, dass ein Fahrgast jede Woche mit einem Ticket aus dem Jahr 1987 reist. Sie beschließt, ihm zu folgen.“ Genre Thriller, 3-Minuten-Episoden, Staffel mit 6 Episoden.
Daraus hat der Bibel-Agent des Drama Studios in 45 Sekunden einen Titel („Le Train de Minuit“), eine Logline, sechs Figuren, darunter eine Erzählerin, fünf Orte mit ihrer für eine Sound-Engine beschriebenen Klanglandschaft, sechs zu verfolgende Handlungsstränge, ein Musikthema und den Plan der sechs Episoden erstellt, die jeweils mit einer Wendung enden. Gemessene Kosten: 6 Credits.
Der wichtigste Punkt dieses Schritts ist die Besetzung. Jede Figur erhält eine feste Stimme, ausgewählt nach Geschlecht, Alter und Klangfarbe, und diese Stimme begleitet sie die ganze Staffel über. Lesen Sie die Figurenbeschreibungen genau: Sie sagen auch, wie jede Figur spricht, und genau das macht die Dialoge lebendig.
Schritt 2: jede Episode mit dem Gedächtnis der Staffel schreiben
Die eigentliche Herausforderung einer Serie ist nicht, eine gute Episode zu schreiben, sondern die siebte zu schreiben, ohne zu vergessen, was in den ersten sechs geschah.
Ein Sprachmodell, das man einfach bittet, „Episode 5 zu schreiben“, erfindet Dinge. Um eine Staffel zusammenzuhalten, braucht der KI-Autor die Bibel, den Staffelplan und ein Gedächtnis: die Zusammenfassung jeder bereits geschriebenen Episode, was jede Figur gelernt hat, und den Stand jedes Handlungsstrangs. Genau das tut das Drama Studio: Nach jeder Episode speichert es sein Gedächtnis, und die nächste Episode setzt genau dort an.
Im Piloten wurde die 3-minütige Episode 1 in 40 Sekunden geschrieben: 60 Repliken, 3 Szenenwechsel, 4 Geräusche, 2 Musikmarker, etwa 3.000 gesprochene Zeichen. Gemessene Kosten: 7 Credits. Das Gedächtnis vermerkte zum Beispiel, dass die Zugbegleiterin das Ticket von 1987 eingescannt hatte und das System es akzeptiert hatte, eine Tatsache, die Episode 2 nicht mehr ignorieren konnte.
Dann folgt die Überprüfung. Ein zweiter Agent, der Lektor, bewertet Aufhänger, Rhythmus, Kohärenz, Dialoge und Schluss auf einer Skala von 10 und weist auf fehlerhafte Repliken hin. Beim Piloten fand er zwei echte Widersprüche, darunter zwei Zugbegleiter, die von zwei verschiedenen Waggons ohne Telefon miteinander sprachen. Kosten: 2 bis 3 Credits. Seine Anmerkungen werden mit einem Klick für eine Neufassung übernommen, und die vorherige Version bleibt wiederherstellbar. Für die Schreibregeln selbst siehe unseren Artikel Ein Hörspiel schreiben, das fesselt.
Schritt 3: die Stimmen spielen lassen
Eine Szene wird in einem Stück gespielt: Alle Repliken gehen gemeinsam an die Sprach-Engine, die die Figuren wie in einem echten Gespräch aneinanderreiht.
Genau darin liegt der Unterschied zwischen einer Lesung und einem Hörspiel. Wenn jede Replik einzeln erzeugt und dann zusammengefügt wird, hört man regelmäßige Lücken und Betonungen, die nicht aufeinander reagieren. Die Dialog-Engine von ElevenLabs, die das Studio nutzt, erhält bis zu zehn Repliken einer Szene mit der Stimme jeder Figur und liefert eine einzige Passage, in der die Reaktionen natürlich aneinander anschließen.
Jede Replik kann eine Spielanweisung tragen: flüstern, lachen, seufzen, neugierig, traurig oder aufgeregt sein. Diese Markierungen verändern die Interpretation tatsächlich, und der Lektor weist auf jene hin, die gegen den Sinn wirken, etwa ein Lachen im Moment einer tragischen Enthüllung.
Die Stimmen spielen in vierzehn Sprachen, und ein und dieselbe Serie kann in der Sprache Ihres Publikums geschrieben und produziert werden. Für eine einzelne Voice-over-Stimme oder einen Zwei-Stimmen-Podcast reichen die Canvas-Werkzeuge KI-Voice-over und Zwei-Stimmen-Podcast aus; für eine Fiktion mit mehreren Figuren ist es das Studio, das die Besetzung von Episode zu Episode beibehält.
Schritt 4: Geräusche, Atmosphären und Musik
Der Sound erzählt genauso viel wie die Stimmen, vorausgesetzt, man setzt ihn sparsam ein: eine Atmosphäre pro Ort, ein Geräusch nur, wenn es die Geschichte trägt, ein Musikthema für die ganze Serie.
Die Atmosphäre ist die lohnendste Ebene: Eine zwanzigsekündige Schleife pro Ort (ein Bahnsteig bei Nacht, das Innere eines fahrenden Zuges) reicht aus, um den Hörer zu verorten, und sie läuft unter jeder Szene, die dort spielt. Im Piloten decken zwei Atmosphären die gesamte Episode ab.
Geräusche müssen dosiert werden. Ohne eine zahlenmäßige Vorgabe setzte die KI elf davon in zwei Minuten ein, und jedes davon zerschnitt einen Dialog. Das Studio begrenzt sich nun auf etwa ein Geräusch pro vierzig Sekunden, reserviert für Klänge, die die Geschichte vorantreiben: eine zuschlagende Tür, ein überreichtes Ticket, ein Abfahrtspfiff. Für einzelne Geräusche funktioniert der Geräuschgenerator des Canvas auch allein.
Das Musikthema wird einmal komponiert, instrumental, und in allen Episoden wiederverwendet: Es eröffnet die Episode, tritt unter den Stimmen zurück, und ein kurzer dramatischer Stinger unterstreicht den Schluss. Das ist die größte Ausgabe der ersten Episode (84 Credits beim Piloten) und die einzige, die sich nicht wiederholt.
Schritt 5: mischen und veröffentlichen
Der Mix legt jeden Klang auf die Zeitlinie, senkt die Musik unter die Stimmen und normalisiert den Pegel auf rund -16 LUFS, den Podcast-Standard.
Im Drama Studio erfolgt das Mixing in Ihrem Browser, kostenlos: Die Dialogblöcke reihen sich in ihrer tatsächlichen Länge aneinander, Geräusche legen sich darüber, ohne den nächsten Satz länger als anderthalb Sekunden zurückzuhalten, jede Atmosphäre läuft in Schleife unter ihrer Szene, und die Musik senkt sich automatisch ab, sobald eine Figur spricht.
Der gemischte Pilot dauert 4 Minuten, misst -16,2 LUFS bei einem echten Spitzenpegel von -1,7 dBFS und wiegt weniger als 4 MB als .m4a-Datei. Während Sie im Studio zuhören, leuchtet die aktuelle Replik im Skript auf, sodass Sie den zu überarbeitenden Satz in einer Sekunde erkennen.
Die Datei gehört Ihnen: Sie laden sie herunter und veröffentlichen sie auf einer Podcast-Plattform, auf YouTube mit einem Standbild oder auf Ihrer Website. Sie wird außerdem in Ihren Imaginode-Medien abgelegt, wo sie als Tonspur für ein auf dem Canvas geschnittenes Video dienen kann.
Was eine Episode wirklich kostet
Beim 3-minütigen Piloten kostete das Schreiben 15 Credits und die Produktion 151, davon 84 für ein Musikthema, das nur einmal bezahlt wird.
Die am 23. September 2026 gemessene Aufschlüsselung: Staffelbibel 6 Credits, Episodenschreiben 7 Credits, Überprüfung 2 bis 3 Credits. In der Produktion 13 Dialogpassagen, 4 Geräusche, 2 Atmosphären, ein dramatischer Stinger und das Musikthema, also 21 Sounds und 151 Credits. Das Mixing kostete nichts.
Ab der zweiten Episode werden das Thema und die Atmosphären bereits besuchter Orte wiederverwendet: Eine 3-minütige Episode kommt dann auf etwa 60 bis 70 Credits für Sound, hinzu kommen rund 10 Credits fürs Schreiben. Für Stimmen allein rechnen Sie mit etwa 12 Credits pro Minute Dialog.
Und ein bereits produzierter Sound wird nie erneut bezahlt: Wenn Sie eine Replik korrigieren, wird nur die Passage, die sie enthält, neu generiert. Das macht Überarbeitungen erschwinglich, selbst spät in der Produktion.
Die Fehler, die Hörer abspringen lassen
Zu viel Erzähler, Figuren, die sich zu ähnlich klingen, Geräusche überall und eine Episode ohne Cliffhanger: vier Fehler, die man vor der Produktion beheben sollte.
Ein Erzähler, der alles erzählt, verwandelt die Fiktion in ein Hörbuch: Setzen Sie ihn nur für Zeit- und Ortssprünge ein und lassen Sie die Figuren die Handlung tragen. Zwei Figuren mit zu ähnlichen Stimmen werden verwechselt: Geben Sie ihnen in der Bibel unterschiedliche Alter, Klangfarben oder Akzente.
Zu viele Geräusche ermüden das Ohr und brechen den Rhythmus: Eine gut gewählte Atmosphäre ersetzt zehn davon. Und eine Episode, die ohne offene Frage endet, gibt keinen Grund, die nächste zu hören: Die „Schluss“-Bewertung des Lektors ist die, die man zuerst im Auge behalten sollte.
Am einfachsten fängt man an, indem man sich eine von Anfang bis Ende produzierte Episode anhört. Die Episode von Le Train de Minuit ist auf der Seite des Drama Studios zu hören, und wenn Sie zwischen mehreren Werkzeugen zögern, erläutert unser Vergleich mit Sherpa von Pocket FM im Detail, was jedes davon wirklich leistet.