Todas as ferramentas

Fazer uma foto falar com IA

Uma foto de rosto e um texto lido por uma voz do catálogo: o InfiniTalk faz a pessoa falar, com lábios, piscadas e movimentos de cabeça incluídos. O vídeo dura o tempo da voz. Todo o workflow é visível sem conta.

Demo interativa

Workflow real, resultados reais. Desloque-se e faça zoom livremente.

Usar este workflow

O workflow real: uma foto em um node Média, dois textos lidos cada um por um node Voz-off, e dois nodes Vídeo configurados para InfiniTalk que recebem a foto pela porta de imagem e a voz pela porta de voz.

Em resumo

O que o workflow produz
2 vídeos de 18 s em 480p, formato 1:1 · 2 vozes off
Estrutura do canvas
8 nodes ligados por 6 ligações
Modelos ligados
ElevenLabs v3, InfiniTalk
Custo de uma passagem completa
cerca de 446 créditos, ou seja US$ 5,35

Uma única foto basta. Sem vídeo para filmar, sem avatar para configurar: o rosto da foto começa a falar, com os lábios ajustados a cada sílaba, as piscadas, os pequenos movimentos de cabeça que acompanham uma frase. O resultado se assiste como uma tomada de frente para a câmera, e vem de um retrato feito com o telefone.

O texto é lido em um node Voz-off, com uma das vozes do catálogo (ElevenLabs v3 em destaque) ou uma voz clonada. O node Vídeo configurado para InfiniTalk recebe a foto e a voz, e renderiza um vídeo que dura exatamente o tempo do áudio, até vinte e oito segundos. O preço acompanha essa duração, medida no arquivo, e aparece antes de você clicar.

É o gesto do avatar que fala, mas a partir do SEU rosto, ou do de um personagem gerado, de uma mascote desenhada, de um retrato antigo. Uma mensagem de aniversário, uma apresentação de produto, um anúncio nas redes: a demonstração mostra duas mensagens na mesma foto.

Como fazer

  1. 1

    Escolha uma foto de frente

    Rosto nítido, boca fechada e visível, luz de frente, fundo simples. Um retrato de telefone funciona muito bem. Óculos e barbas passam, uma mão na frente da boca ou um perfil não.

  2. 2

    Escreva o texto e escolha a voz

    O node Voz-off lê o que você escreve com a voz escolhida, no seu idioma. Uma frase de vinte palavras dura sete a oito segundos. Gere a voz primeiro: é ela que define a duração e o preço do vídeo.

  3. 3

    Gere o vídeo

    O node InfiniTalk mostra a duração medida da voz e o preço exato. Clique: o rosto fala, em 480p para as redes ou em 720p para uma projeção.

  4. 4

    Encadeie se o texto for longo

    Acima de vinte e oito segundos de voz, divida o texto em duas tomadas e edite-as em sequência em um node Montagem, gratuitamente, como nos outros workflows de vídeo.

Variantes e casos de uso

O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.

A mensagem de aniversário

A foto do aniversariante, um texto de vinte palavras lido por uma voz calorosa: esse é o segundo exemplo da demonstração. O vídeo é enviado do jeito que está por mensagem, e ninguém precisou se filmar.

A apresentação de produto sem filmagem

Um retrato gerado se torna um apresentador: o texto de lançamento no node Voz-off, a foto no node Média, e o vídeo sai em 720p, pronto para uma página de produto ou um anúncio UGC.

Um retrato antigo que conta sua história

Uma foto de família digitalizada, um texto escrito na primeira pessoa: o rosto ganha vida e fala. Passe primeiro a foto por um node Melhorar se ela estiver pequena ou danificada, depois pelo InfiniTalk.

A mascote que anuncia

Um personagem desenhado com uma boca legível funciona: o modelo anima os lábios de um desenho como os de uma foto. Ideal para um anúncio de marca nas redes, com uma voz animada do catálogo.

A mesma mensagem em três idiomas

Uma foto, três nodes Voz-off em três idiomas, três nodes InfiniTalk: a mesma pessoa fala inglês, espanhol e português, com os lábios certos a cada vez. Para partir de um vídeo já filmado, veja a dublagem.

A foto que fala, depois que se movimenta

Pegue o vídeo produzido e passe-o por fazer uma foto dançar ou em um node Vídeo como referência: a fala primeiro, o corpo depois.

Erros frequentes

Um rosto de perfil ou de três quartos fechado

O modelo precisa ver a boca inteira. De frente ou em leve três quartos, a sincronização é limpa; de perfil, os lábios se distorcem.

Uma boca aberta ou escondida na foto

Sorriso com dentes visíveis, mão no queixo, microfone na frente: tantos obstáculos. Boca fechada, rosto livre, e o resultado é nítido.

Escrever o texto no node Vídeo

O prompt do node InfiniTalk descreve a atitude, não o texto. O que a pessoa diz é a voz conectada: o texto vai no node Voz-off.

Uma voz longa demais para uma única passagem

Acima de vinte e oito segundos, o node recusa antes de gerar, sem cobrança. Divida em duas tomadas e encadeie-as no node Montagem.

Modelos recomendados

Perguntas frequentes

Por quanto tempo a foto pode falar?

De dois a vinte e oito segundos por geração, cerca de setenta palavras em ritmo normal. O vídeo dura exatamente o tempo da voz conectada: nada para ajustar.

Posso usar minha própria voz?

Sim. Importe uma gravação em um node Média e conecte-a à porta de voz, ou clone sua voz no node Voz-off e faça-a ler qualquer texto.

Preciso de uma foto minha ou um personagem gerado serve?

Os dois. Um retrato gerado por um node Imagem, uma mascote desenhada ou uma foto antiga falam tão bem quanto uma selfie, desde que o rosto esteja de frente e a boca visível.

Sou cobrado se a geração falhar?

Não. O preço é reservado no início e devolvido automaticamente em caso de falha técnica. O valor exato aparece no botão antes de você clicar.

Qual a diferença com o avatar que fala?

O avatar que fala gera um apresentador inventado com sua voz, de uma vez, no Veo. Aqui, é a SUA foto que fala, com a voz de sua escolha, e o texto muda sem regenerar o personagem.

É possível escolher o idioma?

Sim, no node Voz-off: as vozes ElevenLabs leem quatorze idiomas. A sincronização labial acompanha os sons, seja qual for o idioma.

O vídeo é em 16:9 ou vertical?

O InfiniTalk renderiza um quadro próximo ao da foto, em 480p ou 720p. Para um formato preciso, recorte depois no node Montagem, que aceita 9:16, 1:1 e 16:9.

Posso fazer várias pessoas falarem?

Uma pessoa por node. Para um diálogo, faça duas fotos falarem cada uma na sua voz, depois alterne os planos em um node Montagem.

Fazer uma foto falar com IA

Usar este workflow

Conta gratuita, sem cartão. O workflow abre-se pré-preenchido no seu canvas.