-10 % na assinatura mensal com o código NODE10, até 31 de agosto

Imaginode
Todas as ferramentas

Avatar de IA que fala

Um apresentador sintético diz o seu guião à câmara, com a sua voz. O Veo 3.1 gera a imagem e a fala ao mesmo tempo, por isso os lábios caem certos. Visível aqui sem conta.

Demo interativa

Workflow real, resultados reais. Desloque-se e faça zoom livremente.

Usar este workflow

A ficha de referência segura o rosto, o nó Texto leva o guião, o nó Vídeo entrega oito segundos com voz. Nenhum nó de voz off: a fala sai do modelo de vídeo. Abra os nós para ler os prompts.

Em resumo

O que o workflow produz
1 imagem em 9:16 · 1 vídeo de 8 s em 720p, formato 9:16
Estrutura do canvas
5 nodes ligados por 2 ligações
Modelos ligados
Seedream 5 Pro, Veo 3.1 Fast
Custo de uma passagem completa
cerca de 149 créditos, ou seja € 1,49

Um avatar que fala esbarra sempre no mesmo problema: a sincronização labial. As cadeias clássicas geram um vídeo mudo, fabricam uma voz à parte e depois tentam colar as duas, e fica sempre aquele desfasamento de um décimo de segundo que se nota logo.

Aqui a fala e a imagem saem do mesmo render. O Veo 3.1 Fast gera o diálogo com o vídeo: os lábios seguem a voz porque foram calculados juntos. Em troca, mudar uma palavra obriga a relançar o render, por isso o guião fecha-se antes de lançar, e é por isso que vive no seu próprio nó Texto, editável sem tocar na personagem.

O rosto é segurado por uma ficha de referência de três ângulos, a mesma mecânica de manter uma personagem coerente em vários planos. É assim que se produz uma série inteira com o mesmo apresentador, episódio após episódio. O Seedream 5 Pro compõe o plano de partida, e a calculadora pública dá o custo exato de uma tomada antes de qualquer registo.

Como fazer

  1. 1

    Crie o apresentador

    A ficha de referência leva três vistas do rosto. É ela que permite reencontrar exatamente a mesma pessoa no episódio seguinte, noutro cenário e com outro texto.

  2. 2

    Componha o plano

    O nó Imagem enquadra a cena: escritório, luz, espaço deixado para um texto no ecrã. Um plano de peito, ligeiramente descentrado, deixa lugar para os gestos das mãos.

  3. 3

    Escreva a réplica

    O nó Texto contém a encenação e a frase a dizer, entre aspas. Duas frases curtas chegam para oito segundos, e o tom descreve-se como uma indicação de representação.

  4. 4

    Renderize a tomada

    Oito segundos, formato vertical, áudio ligado. A voz chega dentro do ficheiro de vídeo: não há nada para sincronizar a seguir, nem nada para montar se a tomada estiver boa.

Variantes e casos de uso

O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.

Avatar apresentador para formação

Um módulo de formação corta-se em sequências de oito segundos, cada uma no seu node Vídeo, todas ligadas à mesma ficha de rosto. O apresentador fica idêntico de capítulo para capítulo, o que nenhuma série de tomadas reais garante a este preço.

Porta-voz de marca

O mesmo rosto abre cada vídeo da empresa, sem depender da disponibilidade de um colaborador nem da sua saída. Descreva a roupa e o cenário no node Imagem: a ficha segura o rosto, o plano segura o contexto.

Avatar que fala outra língua

Escreva a fala entre aspas na língua pretendida: o Veo 3.1 Fast pronuncia-a, lábios incluídos. Um mesmo vídeo declina-se assim em cinco mercados, com o mesmo apresentador e cinco falas.

Vídeo de boas-vindas numa página web

Oito segundos, plano de peito, escritório desfocado ao fundo: o formato que aumenta o tempo na página. Frase curta, uma ideia por vídeo, e preveja uma legenda para ver sem som.

Avatar vertical para TikTok e Reels

O template já rende em 9:16. Deixe ar por cima da cabeça para texto no ecrã e corte o primeiro meio segundo na montagem: os modelos de vídeo arrancam muitas vezes num plano ligeiramente congelado.

Erros frequentes

Um guião longo demais para oito segundos

Duas frases curtas cabem numa tomada. Para lá disso, o modelo acelera ou corta o fim, e corrigir uma palavra obriga a pagar o render inteiro.

Descrever a voz depois de lançar o render

A voz sai do mesmo render que a imagem: timbre, ritmo e intenção descrevem-se no prompt, antes de gerar. Mudar de voz significa uma tomada nova.

Um grande plano muito fechado

Os planos muito fechados destacam as micro falhas à volta da boca. Um plano de peito, ligeiramente descentrado, deixa lugar às mãos e resulta mais credível.

Modelos recomendados

Perguntas frequentes

Pode escolher-se a voz?

Descreve-se no prompt, como uma indicação de casting: timbre, ritmo, intenção. Não se escolhe de uma lista, e dois renders do mesmo texto podem diferir ligeiramente.

O modelo fala português?

Sim. Escreva a réplica em português entre aspas no prompt, o resto da descrição pode ficar em inglês sem que isso mude a língua falada.

E se a tomada correr mal?

Relança-se. Uma tomada de oito segundos custa algumas dezenas de cêntimos de créditos, e o nó guarda o histórico dos renders anteriores: nada se perde ao comparar duas versões.

A sincronização labial está correta?

Sim, porque a imagem e a fala saem do mesmo render: nada é colado depois. É isso que distingue este workflow das cadeias clássicas, onde um décimo de segundo de desfasamento denuncia a montagem.

Posso usar o meu próprio rosto?

Sim, preenchendo a ficha de Referência com três fotos suas. Faça-o só com o rosto de quem deu autorização: um porta-voz gerado a partir de fotos de terceiros é um problema real de direito à imagem.

Quanto custa uma tomada de oito segundos?

Cerca de 144 créditos com o Veo 3.1 Fast, ou seja 1,40 euros, imagem de partida incluída. O preço exato aparece no botão antes de lançar o render.

Dá para encadear várias falas?

Sim, um node Vídeo por fala, todos ligados à mesma ficha de rosto e ao mesmo plano de partida. Montados seguidos dão um vídeo de um minuto com um apresentador constante.

Avatar de IA que fala

Usar este workflow

Conta gratuita, sem cartão. O workflow abre-se pré-preenchido no seu canvas.