10 % Rabatt auf das Monatsabo mit Code NODE10, bis zum 31. August

Imaginode
Alle Tools

Sprechender KI-Avatar

Eine synthetische Moderatorin sagt Ihr Skript in die Kamera, mit ihrer Stimme. Veo 3.1 erzeugt Bild und Sprache zugleich, die Lippen sitzen also. Hier ohne Konto sichtbar.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Das Referenzblatt hält das Gesicht, der Textknoten trägt das Skript, der Videoknoten liefert acht Sekunden mit Stimme. Kein Off-Knoten: die Sprache kommt aus dem Videomodell. Knoten öffnen und Prompts lesen.

Auf einen Blick

Was der Workflow liefert
1 Bild in 9:16 · 1 Video mit 8 s in 720p, Format 9:16
Aufbau des Canvas
5 Nodes, verbunden durch 2 Kabel
Verdrahtete Modelle
Seedream 5 Pro, Veo 3.1 Fast
Kosten eines kompletten Durchlaufs
rund 149 Credits, also 1,49 €

Ein sprechender Avatar stößt immer auf dasselbe Problem: die Lippensynchronität. Klassische Ketten erzeugen ein stummes Video, bauen die Stimme daneben und versuchen dann, beides zusammenzukleben, und es bleibt dieser Zehntelsekundenversatz, der sofort falsch wirkt.

Hier kommen Sprache und Bild aus demselben Render. Veo 3.1 Fast erzeugt den Dialog mit dem Video: die Lippen folgen der Stimme, weil beide zusammen berechnet wurden. Dafür bedeutet ein geändertes Wort einen neuen Render, das Skript wird also vorher festgezogen, und genau deshalb lebt es in einem eigenen Textknoten, änderbar ohne die Figur anzufassen.

Das Gesicht hält ein Referenzblatt mit drei Ansichten, dieselbe Mechanik wie beim Konsistenthalten einer Figur über mehrere Einstellungen. So entsteht eine ganze Serie mit derselben Moderatorin, Folge für Folge. Seedream 5 Pro baut die Ausgangseinstellung, und der öffentliche Rechner nennt die genauen Kosten einer Aufnahme vor jeder Anmeldung.

So geht's

  1. 1

    Die Moderatorin anlegen

    Das Referenzblatt trägt drei Ansichten des Gesichts. Damit finden Sie in der nächsten Folge exakt dieselbe Person wieder, in anderer Umgebung und mit anderem Text.

  2. 2

    Die Einstellung bauen

    Der Bildknoten setzt die Szene: Büro, Licht, Platz für einen Text im Bild. Ein Bild ab Brusthöhe, leicht aus der Mitte, lässt Raum für Handbewegungen.

  3. 3

    Den Satz schreiben

    Der Textknoten enthält die Inszenierung und den zu sprechenden Satz in Anführungszeichen. Zwei kurze Sätze reichen für acht Sekunden, der Ton wird wie eine Regieanweisung beschrieben.

  4. 4

    Die Aufnahme rendern

    Acht Sekunden, Hochformat, Ton an. Die Stimme steckt in der Videodatei: es gibt nichts zu synchronisieren und nichts zu schneiden, wenn die Aufnahme sitzt.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Moderations-Avatar für einen Kurs

Ein Schulungsmodul zerfällt in Acht-Sekunden-Sequenzen, jede in ihrem Video-Node, alle am selben Gesichtsblatt. Der Moderator bleibt von Kapitel zu Kapitel identisch, was keine Reihe echter Aufnahmen zu diesem Preis garantiert.

Markensprecher

Dasselbe Gesicht eröffnet jedes Unternehmensvideo, unabhängig von der Verfügbarkeit einer Person oder ihrem Weggang. Beschreibe Kleidung und Kulisse im Bild-Node: das Blatt hält das Gesicht, die Einstellung den Kontext.

Avatar in einer anderen Sprache

Schreib den Satz in Anführungszeichen in der Zielsprache: Veo 3.1 Fast spricht ihn aus, Lippen inklusive. Ein Video geht so in fünf Märkte, mit demselben Moderator und fünf Sätzen.

Begrüßungsvideo auf einer Website

Acht Sekunden, Brustaufnahme, unscharfes Büro im Hintergrund: das Format, das die Verweildauer hebt. Kurzer Satz, eine Idee pro Video, und plane einen Untertitel für das Schauen ohne Ton.

Hochkant-Avatar für TikTok und Reels

Die Vorlage rendert bereits in 9:16. Lass Luft über dem Kopf für Text im Bild und schneide die erste halbe Sekunde weg: Videomodelle starten oft auf einem leicht eingefrorenen Bild.

Häufige Fehler

Ein zu langes Skript für acht Sekunden

Zwei kurze Sätze passen in eine Aufnahme. Darüber beschleunigt das Modell oder kappt das Ende, und für ein Wort zahlst du den ganzen Render neu.

Die Stimme erst nach dem Start beschreiben

Die Stimme kommt aus demselben Render wie das Bild: Timbre, Tempo und Absicht gehören vor dem Generieren in den Prompt. Eine andere Stimme heißt eine neue Aufnahme.

Eine sehr enge Großaufnahme

Enge Einstellungen betonen die Mikrofehler rund um den Mund. Eine Brustaufnahme, leicht aus der Mitte, lässt Platz für Handbewegungen und wirkt glaubwürdiger.

Empfohlene Modelle

Häufige Fragen

Lässt sich die Stimme wählen?

Sie beschreiben sie im Prompt wie eine Besetzungsnotiz: Klangfarbe, Tempo, Absicht. Sie wird nicht aus einer Liste gewählt, und zwei Renders desselben Textes können leicht abweichen.

Spricht das Modell Deutsch?

Ja. Schreiben Sie den Satz in Anführungszeichen auf Deutsch, der Rest der Beschreibung kann auf Englisch bleiben, ohne die gesprochene Sprache zu ändern.

Und wenn die Aufnahme misslingt?

Man rendert neu. Eine Aufnahme von acht Sekunden kostet einige Zehntel Euro an Guthaben, und der Knoten behält die früheren Renders: beim Vergleich zweier Fassungen geht nichts verloren.

Stimmt die Lippensynchronität?

Ja, weil Bild und Sprache aus demselben Render kommen: nichts wird nachträglich zusammengeklebt. Genau das unterscheidet diesen Workflow von klassischen Ketten, wo eine Zehntelsekunde Versatz den Schnitt verrät.

Kann ich mein eigenes Gesicht nutzen?

Ja, indem du das Referenzblatt mit drei Fotos von dir füllst. Tu das nur mit dem Gesicht einer Person, die zugestimmt hat: ein Sprecher aus fremden Fotos ist ein echtes Persönlichkeitsrechtsproblem.

Was kostet eine Acht-Sekunden-Aufnahme?

Rund 144 Credits mit Veo 3.1 Fast, also 1,40 Euro, Startbild inklusive. Der genaue Preis steht vor dem Start auf dem Button.

Lassen sich mehrere Sätze aneinanderreihen?

Ja, ein Video-Node pro Satz, alle am selben Gesichtsblatt und derselben Startaufnahme. Hintereinander geschnitten ergibt das ein Minutenvideo mit konstantem Moderator.

Sprechender KI-Avatar

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.