Alle Tools

Ein Foto mit KI sprechen lassen

Ein Gesichtsfoto und ein Text, gelesen von einer Katalogstimme: InfiniTalk lässt die Person sprechen, inklusive Lippen, Blinzeln und Kopfbewegungen. Das Video dauert genauso lange wie die Stimme. Der gesamte Workflow ist ohne Konto sichtbar.

Interaktive Demo

Echter Workflow, echte Ergebnisse. Beweg dich frei und zoome nach Belieben.

Diesen Workflow verwenden

Der echte Workflow: ein Foto in einem Medien-Node, zwei Texte, jeweils von einem Voice-over-Node gelesen, und zwei Video-Nodes, eingestellt auf InfiniTalk, die das Foto über den Bild-Port und die Stimme über den Voice-Port erhalten.

Auf einen Blick

Was der Workflow liefert
2 Videos mit 18 s in 480p, Format 1:1 · 2 Voice-overs
Aufbau des Canvas
8 Nodes, verbunden durch 6 Kabel
Verdrahtete Modelle
ElevenLabs v3, InfiniTalk
Kosten eines kompletten Durchlaufs
rund 446 Credits, also 4,46 €

Ein einziges Foto reicht. Kein Video zu drehen, kein Avatar zu konfigurieren: Das Gesicht auf dem Foto beginnt zu sprechen, mit Lippen, die auf jede Silbe abgestimmt sind, mit Blinzeln, mit den kleinen Kopfbewegungen, die einen Satz begleiten. Das Ergebnis wirkt wie eine Aufnahme direkt in die Kamera, und es stammt von einem Handy-Porträt.

Der Text wird in einem Voice-over-Node gelesen, mit einer der Katalogstimmen (ElevenLabs v3 an erster Stelle) oder einer geklonten Stimme. Der auf InfiniTalk eingestellte Video-Node erhält das Foto und die Stimme und rendert ein Video, das genau so lange dauert wie das Audio, bis zu achtundzwanzig Sekunden. Der Preis richtet sich nach dieser Dauer, gemessen an der Datei, und wird angezeigt, bevor Sie klicken.

Es ist die Geste des sprechenden Avatars, aber ausgehend von IHREM Gesicht, oder dem einer generierten Figur, einem gezeichneten Maskottchen, einem alten Porträt. Eine Geburtstagsbotschaft, eine Produktpräsentation, eine Ankündigung in sozialen Netzwerken: Die Demo zeigt zwei Botschaften auf demselben Foto.

So geht's

  1. 1

    Wählen Sie ein Frontalfoto

    Scharfes Gesicht, geschlossener und sichtbarer Mund, Licht von vorne, schlichter Hintergrund. Ein Handy-Porträt eignet sich sehr gut. Brillen und Bärte gehen durch, eine Hand vor dem Mund oder ein Profil nicht.

  2. 2

    Schreiben Sie den Text und wählen Sie die Stimme

    Der Voice-over-Node liest, was Sie schreiben, mit der gewählten Stimme, in Ihrer Sprache. Ein Satz mit zwanzig Wörtern ergibt sieben bis acht Sekunden. Erzeugen Sie zuerst die Stimme: Sie legt die Dauer und den Preis des Videos fest.

  3. 3

    Erzeugen Sie das Video

    Der InfiniTalk-Node zeigt die gemessene Dauer der Stimme und den genauen Preis an. Klicken Sie: Das Gesicht spricht, in 480p für soziale Netzwerke oder in 720p für eine Projektionsvorführung.

  4. 4

    Verketten Sie bei langem Text

    Über achtundzwanzig Sekunden Stimme hinaus teilen Sie den Text in zwei Aufnahmen auf und fügen Sie sie kostenlos in einem Montage-Node aneinander, wie in den anderen Video-Workflows.

Varianten und Anwendungsfälle

Derselbe Canvas, anders eingestellt: jede Variante kostet zwei bis drei geänderte Prompt-Zeilen.

Die Geburtstagsbotschaft

Das Foto der gefeierten Person, ein Text mit zwanzig Wörtern, gelesen von einer warmen Stimme: das ist das zweite Beispiel der Demo. Das Video wird so, wie es ist, per Nachricht versendet, und niemand musste sich selbst filmen.

Die Produktpräsentation ohne Dreh

Ein generiertes Porträt wird zum Präsentator: der Launch-Text im Voice-over-Node, das Foto im Medien-Node, und das Video kommt in 720p heraus, bereit für eine Produktseite oder eine UGC-Werbung.

Ein altes Porträt, das erzählt

Ein digitalisiertes Familienfoto, ein in der Ich-Form geschriebener Text: das Gesicht erwacht zum Leben und spricht. Führen Sie das Foto zuerst durch einen Verbessern-Node, wenn es klein oder beschädigt ist, dann durch InfiniTalk.

Das Maskottchen, das ankündigt

Eine gezeichnete Figur mit einem lesbaren Mund funktioniert: Das Modell animiert die Lippen einer Zeichnung wie die eines Fotos. Ideal für eine Markenankündigung in sozialen Netzwerken, mit einer fröhlichen Katalogstimme.

Dieselbe Botschaft in drei Sprachen

Ein Foto, drei Voice-over-Nodes in drei Sprachen, drei InfiniTalk-Nodes: Dieselbe Person spricht Englisch, Spanisch und Französisch, jedes Mal mit präzisen Lippen. Um von einem bereits gedrehten Video auszugehen, siehe Synchronisation.

Das Foto, das spricht, dann sich bewegt

Nehmen Sie das erzeugte Video und führen Sie es durch ein Foto tanzen lassen oder in einen Video-Node als Referenz: erst die Sprache, dann der Körper.

Häufige Fehler

Ein Gesicht im Profil oder eng in Dreiviertelansicht

Das Modell muss den ganzen Mund sehen. Frontal oder in leichter Dreiviertelansicht ist die Synchronisation saubet; im Profil verzerren sich die Lippen.

Ein offener oder verdeckter Mund auf dem Foto

Ein Lächeln mit sichtbaren Zähnen, eine Hand am Kinn, ein Mikrofon davor: alles Hindernisse. Mund geschlossen, Gesicht frei, und das Ergebnis wird scharf.

Den Text im Video-Node schreiben

Der Prompt des InfiniTalk-Nodes beschreibt die Haltung, nicht den Text. Was die Person sagt, ist die verbundene Stimme: Der Text gehört in den Voice-over-Node.

Eine Stimme, die für eine einzelne Aufnahme zu lang ist

Über achtundzwanzig Sekunden hinaus verweigert der Node die Generierung, ohne Kosten. Teilen Sie in zwei Aufnahmen auf und verketten Sie sie im Montage-Node.

Empfohlene Modelle

Häufige Fragen

Wie lange kann das Foto sprechen?

Von zwei bis achtundzwanzig Sekunden pro Generierung, also etwa sechzig Wörter im normalen Sprechtempo. Das Video dauert genau so lange wie die verbundene Stimme: nichts einzustellen.

Kann ich meine eigene Stimme verwenden?

Ja. Laden Sie eine Aufnahme in einen Medien-Node hoch und verbinden Sie ihn mit dem Voice-Port, oder klonen Sie Ihre Stimme im Voice-over-Node und lassen Sie sie beliebigen Text lesen.

Brauche ich ein Foto von mir, oder funktioniert eine generierte Figur auch?

Beides. Ein von einem Bild-Node generiertes Porträt, ein gezeichnetes Maskottchen oder ein altes Foto sprechen genauso gut wie ein Selfie, solange das Gesicht frontal und der Mund sichtbar ist.

Wird das Ergebnis berechnet, wenn die Generierung fehlschlägt?

Nein. Der Preis wird beim Start reserviert und bei einem technischen Fehler automatisch zurückerstattet. Der genaue Betrag wird auf der Schaltfläche angezeigt, bevor Sie klicken.

Was ist der Unterschied zum sprechenden Avatar?

Der sprechende Avatar erzeugt einen erfundenen Präsentator mit seiner Stimme, in einem Schritt, auf Veo. Hier spricht IHR Foto, mit der Stimme Ihrer Wahl, und der Text ändert sich, ohne die Figur neu zu generieren.

Kann ich die Sprache wählen?

Ja, im Voice-over-Node: Die ElevenLabs-Stimmen lesen vierzehn Sprachen. Die Lippensynchronisation folgt den Lauten, unabhängig von der Sprache.

Ist das Video im Format 16:9 oder vertikal?

InfiniTalk rendert einen Bildausschnitt nahe am Foto, in 480p oder 720p. Für ein genaues Format schneiden Sie anschließend im Montage-Node zu, der 9:16, 1:1 und 16:9 unterstützt.

Kann ich mehrere Personen sprechen lassen?

Eine Person pro Node. Für einen Dialog lassen Sie zwei Fotos jeweils auf ihrer eigenen Stimme sprechen und wechseln Sie dann die Einstellungen in einem Montage-Node ab.

Ein Foto mit KI sprechen lassen

Diesen Workflow verwenden

Kostenloses Konto, ohne Kreditkarte. Der Workflow öffnet sich vorausgefüllt in deinem Canvas.