Der Spot in fünf Sprachen
Eine auf Französisch gedrehte Werbung wird zu fünf Dateien: ein Voice-over-Node pro Sprache, ein Sync-Lipsync-3-Node pro Sprache, dasselbe Video als Eingabe. Das Budget lässt sich vor dem Start auf jedem Button ablesen.
Ein Video, in dem jemand spricht, eine neue Stimme in einer anderen Sprache: Sync Lipsync 3 richtet die Lippen neu auf den neuen Text aus. Dieselbe Aufnahme auf Englisch und auf Spanisch, ohne neu zu drehen. Der gesamte Workflow ist ohne Konto sichtbar.
Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.
Diesen Workflow verwendenDer echte Workflow: das Video des Avatars in einem Medien-Node, zwei Übersetzungen, die jeweils von einem Voice-over-Node gelesen werden, und zwei Video-Nodes, eingestellt auf Sync Lipsync 3, die das Video über den Video-Port und die Stimme über den Stimm-Port erhalten.
Auf einen Blick
Ein einmal gedrehtes Video, geliefert in so vielen Sprachen wie nötig: genau das leistet die Synchronisation mit Lippensynchronisierung. Die Person auf dem Bildschirm spricht nicht mehr den Originalsatz, sondern die Übersetzung, und ihr Mund folgt der neuen Stimme Bild für Bild. Gesicht, Beleuchtung und Bildausschnitt bleiben die des Drehs.
Der übersetzte Text wird in einem Voice-over-Node gelesen, mit einer Stimme aus dem Katalog oder einer geklonten Stimme, zum Beispiel Ihrer eigenen. Der Video-Node, eingestellt auf Sync Lipsync 3, erhält das Video und die Stimme und rendert die synchronisierte Aufnahme. Der Preis richtet sich nach der erzeugten Dauer, gemessen an Ihren beiden Dateien, und wird vor dem Klick angezeigt.
Die Demo geht vom Video des sprechenden Avatars aus, auf Französisch, und rendert es auf Englisch und dann auf Spanisch. Ein Spot, ein internes Schulungsvideo, eine Produktpräsentation: ein Dreh, eine Datei pro Markt.
Laden Sie das gesprochene Video hoch
Ein Gesicht von vorne, gut beleuchtet, Mund sichtbar, ohne Hand oder Mikrofon davor. Bis zu zwei Minuten pro Durchgang. Eine mit dem Handy gefilmte Aufnahme funktioniert.
Schreiben Sie die Übersetzung und wählen Sie die Stimme
Jeder Voice-over-Node liest einen Text in einer Sprache. Wählen Sie eine Stimme, die der Person nahekommt, oder klonen Sie ihre eigene, um ihr Timbre von einer Sprache zur nächsten zu bewahren.
Stellen Sie ein, wie sich die Dauern treffen
Standardmäßig endet das Ergebnis bei der kürzeren der beiden Dauern. Wenn die Stimme länger ist als die Aufnahme, wählen Sie „Schleife“: Das Video wiederholt sich unter der Stimme, was bei einer Aufnahme frontal zur Kamera gut funktioniert.
Generieren und vergleichen
Ein Node pro Sprache, alle mit demselben Video verbunden. Der Preis jedes Nodes richtet sich nach seiner Dauer. Starten Sie nur die Sprache neu, die Ihnen nicht gefällt.
Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.
Eine auf Französisch gedrehte Werbung wird zu fünf Dateien: ein Voice-over-Node pro Sprache, ein Sync-Lipsync-3-Node pro Sprache, dasselbe Video als Eingabe. Das Budget lässt sich vor dem Start auf jedem Button ablesen.
Ein Trainer, frontal zur Kamera gefilmt, der Text von einem Text-Node übersetzt, von einem Voice-over-Node gelesen, und das Video synchronisiert für Teams im Ausland. Der Schnitt bleibt derselbe.
Die Synchronisation ist auch in derselben Sprache nützlich: ein falsch gesagter Satz, ein geänderter Preis, ein zu korrigierender Name. Schreiben Sie den Text neu, starten Sie erneut, der Mund folgt.
Ein authentisches Testimonial gewinnt ein ausländisches Publikum, ohne das Gesicht der Person zu verlieren: synchronisieren Sie es mit einer ähnlichen Stimme und behalten Sie die Untertitel für die Barrierefreiheit bei.
Gehen Sie von einem Video aus, das vom sprechenden Avatar oder einer UGC-Werbung erstellt wurde, und synchronisieren Sie es: Die synthetische Figur spricht jede Sprache, ohne die Aufnahme neu zu generieren.
Wenn Sie kein Ausgangsvideo haben, lassen Sie ein Foto sprechen: InfiniTalk erfindet die Gesichtsbewegung anhand eines Porträts und einer Stimme.
Das Modell synchronisiert ein Gesicht. Mit zwei Personen im Bild ist das Ergebnis unvorhersehbar. Bilden Sie diejenige Person ab, die spricht.
Im Schnittmodus endet das Ergebnis mit dem Video, und das Ende des Textes verschwindet. Kürzen Sie die Übersetzung oder wechseln Sie in den Schleifenmodus.
Hand, Mikrofon, Tasse: Alles, was vor dem Mund vorbeizieht, bricht die Synchronisation auf diesen Bildern. Halten Sie das Gesicht beim Dreh frei.
Das Ergebnis enthält nur die Stimme. Fügen Sie die Musik im Montage-Node wieder ein, sonst klingt die synchronisierte Version kahler als das Original.
Nein: genau darum geht es. Ein einziges Video, ein Voice-over-Node pro Sprache, und die Lippen folgen jeder Übersetzung.
Nein, die Audiospur des Ergebnisses ist die verbundene Stimme. Um Musik oder Atmosphäre zu erhalten, fügen Sie diese in einem Montage-Node über das synchronisierte Video ein.
Ja: Klonen Sie Ihre Stimme im Voice-over-Node, schreiben Sie die Übersetzung, und die geklonte Stimme liest sie vor. Die Lippen folgen.
Von einer Sekunde bis zu zwei Minuten pro Durchgang. Darüber hinaus schneiden Sie das Video im Montage-Node und synchronisieren die Teile einzeln.
Der Preis richtet sich nach der erzeugten Dauer, pro Sekunde, und wird auf dem Button angezeigt, sobald Video und Stimme verbunden sind. Ein technischer Fehler wird automatisch erstattet.
Ja, genauso gut wie bei einem echten Dreh. Eine Wan-, Seedance- oder Veo-Aufnahme mit einem frontalen Gesicht lässt sich wie jedes andere Video synchronisieren.
Ja: Nur der Mund wird neu berechnet. Hände, Augenbrauen und Kopfbewegungen entsprechen der Originalaufnahme.
Eine Stimme im selben Register wie die Person oder ihr Klon. Hören Sie sich die Stimme allein im Voice-over-Node an, bevor Sie die Synchronisation starten.
Ein Video mit KI synchronisieren, Lippen im Takt
Diesen Workflow verwendenKostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.