Alle Tools

Ein Video mit KI synchronisieren, Lippen im Takt

Ein Video, in dem jemand spricht, eine neue Stimme in einer anderen Sprache: Sync Lipsync 3 richtet die Lippen neu auf den neuen Text aus. Dieselbe Aufnahme auf Englisch und auf Spanisch, ohne neu zu drehen. Der gesamte Workflow ist ohne Konto sichtbar.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: das Video des Avatars in einem Medien-Node, zwei Übersetzungen, die jeweils von einem Voice-over-Node gelesen werden, und zwei Video-Nodes, eingestellt auf Sync Lipsync 3, die das Video über den Video-Port und die Stimme über den Stimm-Port erhalten.

Auf einen Blick

Was der Workflow liefert
2 Videos mit 12 s in 720p, Format 9:16 · 2 Voice-overs
Aufbau des Canvas
8 Nodes, verbunden durch 6 Kabel
Verdrahtete Modelle
ElevenLabs v3, Sync Lipsync 3
Kosten eines kompletten Durchlaufs
rund 208 Credits, also 2,08 €

Ein einmal gedrehtes Video, geliefert in so vielen Sprachen wie nötig: genau das leistet die Synchronisation mit Lippensynchronisierung. Die Person auf dem Bildschirm spricht nicht mehr den Originalsatz, sondern die Übersetzung, und ihr Mund folgt der neuen Stimme Bild für Bild. Gesicht, Beleuchtung und Bildausschnitt bleiben die des Drehs.

Der übersetzte Text wird in einem Voice-over-Node gelesen, mit einer Stimme aus dem Katalog oder einer geklonten Stimme, zum Beispiel Ihrer eigenen. Der Video-Node, eingestellt auf Sync Lipsync 3, erhält das Video und die Stimme und rendert die synchronisierte Aufnahme. Der Preis richtet sich nach der erzeugten Dauer, gemessen an Ihren beiden Dateien, und wird vor dem Klick angezeigt.

Die Demo geht vom Video des sprechenden Avatars aus, auf Französisch, und rendert es auf Englisch und dann auf Spanisch. Ein Spot, ein internes Schulungsvideo, eine Produktpräsentation: ein Dreh, eine Datei pro Markt.

So geht's

  1. 1

    Laden Sie das gesprochene Video hoch

    Ein Gesicht von vorne, gut beleuchtet, Mund sichtbar, ohne Hand oder Mikrofon davor. Bis zu zwei Minuten pro Durchgang. Eine mit dem Handy gefilmte Aufnahme funktioniert.

  2. 2

    Schreiben Sie die Übersetzung und wählen Sie die Stimme

    Jeder Voice-over-Node liest einen Text in einer Sprache. Wählen Sie eine Stimme, die der Person nahekommt, oder klonen Sie ihre eigene, um ihr Timbre von einer Sprache zur nächsten zu bewahren.

  3. 3

    Stellen Sie ein, wie sich die Dauern treffen

    Standardmäßig endet das Ergebnis bei der kürzeren der beiden Dauern. Wenn die Stimme länger ist als die Aufnahme, wählen Sie „Schleife“: Das Video wiederholt sich unter der Stimme, was bei einer Aufnahme frontal zur Kamera gut funktioniert.

  4. 4

    Generieren und vergleichen

    Ein Node pro Sprache, alle mit demselben Video verbunden. Der Preis jedes Nodes richtet sich nach seiner Dauer. Starten Sie nur die Sprache neu, die Ihnen nicht gefällt.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Der Spot in fünf Sprachen

Eine auf Französisch gedrehte Werbung wird zu fünf Dateien: ein Voice-over-Node pro Sprache, ein Sync-Lipsync-3-Node pro Sprache, dasselbe Video als Eingabe. Das Budget lässt sich vor dem Start auf jedem Button ablesen.

Das übersetzte Schulungsvideo

Ein Trainer, frontal zur Kamera gefilmt, der Text von einem Text-Node übersetzt, von einem Voice-over-Node gelesen, und das Video synchronisiert für Teams im Ausland. Der Schnitt bleibt derselbe.

Einen Satz korrigieren, ohne neu zu drehen

Die Synchronisation ist auch in derselben Sprache nützlich: ein falsch gesagter Satz, ein geänderter Preis, ein zu korrigierender Name. Schreiben Sie den Text neu, starten Sie erneut, der Mund folgt.

Das untertitelte, dann synchronisierte Kundenzeugnis

Ein authentisches Testimonial gewinnt ein ausländisches Publikum, ohne das Gesicht der Person zu verlieren: synchronisieren Sie es mit einer ähnlichen Stimme und behalten Sie die Untertitel für die Barrierefreiheit bei.

Der generierte Avatar in jeder Sprache

Gehen Sie von einem Video aus, das vom sprechenden Avatar oder einer UGC-Werbung erstellt wurde, und synchronisieren Sie es: Die synthetische Figur spricht jede Sprache, ohne die Aufnahme neu zu generieren.

Ein Foto statt eines Videos

Wenn Sie kein Ausgangsvideo haben, lassen Sie ein Foto sprechen: InfiniTalk erfindet die Gesichtsbewegung anhand eines Porträts und einer Stimme.

Häufige Fehler

Ein Video mit mehreren Gesichtern

Das Modell synchronisiert ein Gesicht. Mit zwei Personen im Bild ist das Ergebnis unvorhersehbar. Bilden Sie diejenige Person ab, die spricht.

Eine Stimme, die viel länger ist als die Aufnahme

Im Schnittmodus endet das Ergebnis mit dem Video, und das Ende des Textes verschwindet. Kürzen Sie die Übersetzung oder wechseln Sie in den Schleifenmodus.

Ein während der Aufnahme verdeckter Mund

Hand, Mikrofon, Tasse: Alles, was vor dem Mund vorbeizieht, bricht die Synchronisation auf diesen Bildern. Halten Sie das Gesicht beim Dreh frei.

Musik und Atmosphäre vergessen

Das Ergebnis enthält nur die Stimme. Fügen Sie die Musik im Montage-Node wieder ein, sonst klingt die synchronisierte Version kahler als das Original.

Empfohlene Modelle

Häufige Fragen

Muss ich das Video für jede Sprache neu drehen?

Nein: genau darum geht es. Ein einziges Video, ein Voice-over-Node pro Sprache, und die Lippen folgen jeder Übersetzung.

Bleibt die Originalstimme erhalten?

Nein, die Audiospur des Ergebnisses ist die verbundene Stimme. Um Musik oder Atmosphäre zu erhalten, fügen Sie diese in einem Montage-Node über das synchronisierte Video ein.

Kann ich mit meiner eigenen Stimme in einer anderen Sprache synchronisieren?

Ja: Klonen Sie Ihre Stimme im Voice-over-Node, schreiben Sie die Übersetzung, und die geklonte Stimme liest sie vor. Die Lippen folgen.

Welche Videolänge wird akzeptiert?

Von einer Sekunde bis zu zwei Minuten pro Durchgang. Darüber hinaus schneiden Sie das Video im Montage-Node und synchronisieren die Teile einzeln.

Wie viel kostet die Synchronisation eines Videos?

Der Preis richtet sich nach der erzeugten Dauer, pro Sekunde, und wird auf dem Button angezeigt, sobald Video und Stimme verbunden sind. Ein technischer Fehler wird automatisch erstattet.

Funktioniert die Synchronisation bei einem KI-generierten Video?

Ja, genauso gut wie bei einem echten Dreh. Eine Wan-, Seedance- oder Veo-Aufnahme mit einem frontalen Gesicht lässt sich wie jedes andere Video synchronisieren.

Bleiben Gesten und Mimik erhalten?

Ja: Nur der Mund wird neu berechnet. Hände, Augenbrauen und Kopfbewegungen entsprechen der Originalaufnahme.

Welche Stimme sollte man für eine glaubwürdige Synchronisation wählen?

Eine Stimme im selben Register wie die Person oder ihr Klon. Hören Sie sich die Stimme allein im Voice-over-Node an, bevor Sie die Synchronisation starten.

Ein Video mit KI synchronisieren, Lippen im Takt

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.