Die komplette Kette eines Erklärkanals: ein Thema hinein, ein von einem Sprachmodell geschriebenes Skript, eine Stimme aus dem Off, drei Einstellungen und ein Zehnsekundenschnitt. Hier ohne Konto sichtbar.
Interaktive Demo
Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.
Der ganze Ablauf ist hier: der Textknoten schreibt das Skript, die Stimme liest es, die Bildsprache hält die drei Einstellungen, der Videoknoten liefert den Schnitt. Verschieben, zoomen, Knoten öffnen.
Auf einen Blick
Was der Workflow liefert
3 Bilder in 16:9 · 1 Video mit 10 s in 720p, Format 16:9 · 1 Voice-over
Aufbau des Canvas
10 Nodes, verbunden durch 7 Kabel
Verdrahtete Modelle
Kimi K2.5, OpenAI TTS HD, Seedream 5 Pro, Seedance 2.0
Kosten eines kompletten Durchlaufs
rund 139 Credits, also 1,39 €
Ein Kanal ohne Gesicht lebt von einer Sache: schnell und oft produzieren, ohne sich je zu filmen. Ein einzelnes Eingabefeld reicht dafür nicht, denn so ein Video ist kein bewegtes Bild, sondern eine Produktionskette: ein Thema, ein Text, eine Stimme, Einstellungen, ein Schnitt. Dieser Ablauf zeigt alle fünf Glieder nebeneinander, und genau das bekommen Sie beim Öffnen der Vorlage.
Der Textknoten des Skripts ist der einzige im Produkt, der ein Sprachmodell trägt: Sie tippen ein Thema, er liefert den Off-Text, und derselbe Text läuft in den Stimmknoten. Nichts zwischen zwei Werkzeugen zu kopieren, und nichts neu zu machen, wenn das Thema wechselt. Die Stimme bleibt in ihrem eigenen Knoten statt im Video: Sie lässt sich beliebig oft neu erzeugen, ohne den Schnitt erneut zu bezahlen.
Bei den Modellen hält Seedream 5 Pro die Einstellungen, Seedance 2.0 kann innerhalb einer Aufnahme schneiden und liefert vier Einstellungen in einem Zehnsekundenrender, und OpenAI TTS HD liest das Skript. Der Leitfaden was ist ein KI-Workflow erklärt, warum das Verketten das Ergebnis verändert, und der öffentliche Rechner nennt die genauen Kosten vor jeder Anmeldung.
So geht's
1
Thema angeben
Der erste Textknoten enthält eine Zeile: das Thema des Videos. Es ist die einzige Stelle, die sich für die nächste Folge ändert.
2
Das Skript schreiben lassen
Der zweite Textknoten trägt ein Sprachmodell und eine Schreibanweisung. Rechnen Sie mit etwa dreißig Wörtern pro zehn Sekunden: darüber läuft die Stimme den Bildern hinterher.
3
Bildsprache festziehen
Der Knoten Bildsprache beschreibt Material, Palette und Licht ein einziges Mal und speist alle drei Einstellungen. Ohne ihn wirken die drei Bilder nicht wie aus einem Video.
4
In einem Render schneiden
Der Videoprompt beschreibt vier nummerierte Einstellungen, harte Schnitte, je zweieinhalb Sekunden. Der Schnitt kommt stumm heraus: die Stimme legt sich darüber und bleibt einzeln änderbar.
Varianten und Anwendungsfälle
Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.
Kanal für Mystery und wahre Fälle
Die dichteste Faceless-Nische: ein ungelöster Fall, ein Verschwinden, ein Rätsel. Der Skript-Text-Node schreibt die Erzählung aus deinem Thema, das Voice-over liest sie, und die drei Einstellungen zeigen Orte statt Menschen. Gesichter verraten ein generiertes Video am schnellsten.
Wissenschaftliche Erklärvideos
Gleiche Kette, anderer Ton: eine Frage am Anfang, eine Erklärung in drei Schritten, ein Schluss. Lies immer nach, was das Sprachmodell geschrieben hat, bevor du die Stimme generierst: bei Fachthemen behauptet es Falsches im selben ruhigen Ton.
Hochkant-Shorts aus demselben Skript
Das Skript lebt in seinem Node: dupliziere den Video-Node in 9:16, nimm drei statt fünf Einstellungen, und du hast das Kurzformat, ohne eine Zeile neu zu schreiben. Das ist der Hauptgewinn eines Canvas gegenüber einem Ein-Feld-Generator.
Faceless-Video in einer anderen Sprache
Schreib das Thema in der Zielsprache: das Sprachmodell formuliert darin und OpenAI TTS HD liest es sauber vor. Derselbe Canvas liefert so eine Fassung pro Markt, mit denselben Einstellungen und anderem Voice-over.
Serie mit festem Rhythmus
Ein Faceless-Kanal lebt von Regelmäßigkeit. Halte einen Canvas pro Serie: von Folge zu Folge ändert sich nur der Themen-Node, Art Direction und Stimme bleiben, und die visuelle Identität baut sich von allein.
Häufige Fehler
Die Stimme vor dem Korrekturlesen generieren
Ein Voice-over auf ungeprüftem Text muss wegen eines Wortes komplett neu. Erst lesen, dann generieren: die Stimme sitzt genau deshalb in einem eigenen Node.
Drei Einstellungen ohne gemeinsame Art Direction
Ohne Stil-Node an allen drei Bildern wirkt das Video wie drei zusammengeklebte Videos. Das ist der Fehler, bei dem nach vier Sekunden abgeschaltet wird.
Ein Achtzig-Wort-Skript für zehn Sekunden
Rechne mit dreißig Wörtern pro zehn Sekunden. Ein zu langes Skript ergibt eine gehetzte Stimme, und der Schnitt hinkt der Erzählung durchgehend hinterher.
Weil eine im Render eingebackene Stimme bedeutet, für ein einziges Wort das ganze Video erneut zu bezahlen. Im eigenen Knoten kostet sie ein paar Cent, und sie gibt die Länge der Einstellungen vor.
Was kostet ein solches Video?
Drei Bilder, eine Stimme und ein Zehnsekundenschnitt liegen bei rund anderthalb Euro an Guthaben. Die Aufschlüsselung pro Modell steht im Rechner.
Geht es länger als zehn Sekunden?
Ja, indem mehrere Videoknoten auf derselben Fläche verkettet werden, jeder ausgehend vom letzten Bild des vorherigen. Die Vorlage zeigt einen, damit sie lesbar bleibt, darüber hinaus ist die Mechanik dieselbe.
Lässt sich ein Faceless-Kanal auf YouTube monetarisieren?
Ja, sofern du Eigenes beisteuerst: originales Skript, Schnitt, Stimme, Haltung. YouTube sanktioniert wiederholenden, nicht authentischen Inhalt, nicht das fehlende Gesicht oder den Einsatz von Generierungswerkzeugen.
Welches Sprachmodell schreibt das Skript?
Der Text-Node der Vorlage nutzt Kimi K2.5 für einen Credit pro Generierung. Jedes andere Sprachmodell des Katalogs kann es im selben Node ersetzen.
Ist ein Video pro Tag machbar?
Ja: steht der Canvas, heißt eine Folge Thema ändern und neu starten, also rund zehn Minuten und etwa 1,40 Euro Credits für zehn geschnittene Sekunden.
Muss ich angeben, dass das Video KI-generiert ist?
YouTube verlangt, realistische synthetische Inhalte, die täuschen könnten, beim Upload zu kennzeichnen. Eine mit generierten Bildern bebilderte Doku wird gekennzeichnet, und das kostet weder Monetarisierung noch Reichweite.