Todas as ferramentas

Voz off IA: o mesmo texto lido por três motores

O mesmo guião lido por três motores de síntese de voz, ElevenLabs v3, MiniMax Speech 2.8 HD e OpenAI TTS HD, para escolher a sua voz off de ouvido. O fluxo completo, sem criar conta.

Demo interativa

Workflow real, resultados reais. Desloque-se e faça zoom livremente.

Usar este workflow

O fluxo real: um node Texto leva o guião, três nodes de Voz off leem-no cada um com o seu motor, e você ouve.

Em resumo

O que o workflow produz
3 vozes off
Estrutura do canvas
5 nodes ligados por 3 ligações
Modelos ligados
ElevenLabs v3, MiniMax Speech 2.8 HD, OpenAI TTS HD
Custo de uma passagem completa
cerca de 17 créditos, ou seja US$ 0,20

Uma voz off para um vídeo, um texto lido para um tutorial, uma narração para um podcast: a pergunta nunca é «pode-se gerar uma voz» mas «qual». Este fluxo responde de ouvido. O guião vive num node Texto e chega por cabo a três nodes de Voz off, cada um com um motor diferente: mude uma frase, volte a lançar, os três releem.

Os três não estão ali por acaso. O ElevenLabs v3 é o mais expressivo, interpreta as vírgulas e os pontos, e é o mais caro. O MiniMax Speech 2.8 HD é o mais natural, com um ligeiro sotaque nalguns nomes próprios. O OpenAI TTS HD é o motor por defeito do node, regular, metade do preço. Cada node propõe as suas próprias vozes, a sua velocidade e, no ElevenLabs, etiquetas de interpretação.

O guião da demo dura uns quinze segundos, com uma vírgula, uma enumeração e uma palavra difícil, o suficiente para ouvir a prosódia de cada um. As três leituras custam vinte cêntimos; o node lê o texto nas catorze línguas do site.

Como fazer

  1. 1

    Escreva o guião no node Texto

    Uma pontuação cuidada faz metade do trabalho: os motores respiram nas vírgulas e baixam a voz nos pontos. Escreva os números por extenso quando a leitura tiver de ser exata.

  2. 2

    Lance as três leituras

    «Gerar tudo» lança os três nodes de uma vez. Cada node mostra o seu preço antes do clique, calculado sobre o comprimento do texto.

  3. 3

    Ouça a mesma passagem

    Compare na frase mais difícil, a do nome próprio ou da enumeração. É aí que os motores se separam, não na primeira frase.

  4. 4

    Mude a voz, não o motor

    Cada motor tem várias vozes, e uma voz que não serve não condena o motor. Experimente duas ou três no mesmo node antes de o trocar.

Variantes e casos de uso

O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.

Uma voz off para um vídeo do YouTube

O guião de um vídeo de dez minutos, lido de uma vez. O MiniMax aguenta a duração sem cansar o ouvido; o ElevenLabs é mais vivo mas mais caro em dez minutos. O fluxo vídeo do YouTube sem rosto continua com as imagens.

Um anúncio de vinte segundos

Vinte segundos em que cada palavra conta: é o terreno do ElevenLabs v3, que aceita etiquetas de interpretação no texto, um riso, um suspiro, um sussurro. O fluxo anúncio cinematográfico mostra a voz assente nas imagens.

Um texto lido para aprender

Uma aula, um artigo, um capítulo para ouvir a andar. O motor por defeito chega e é o que custa menos: a regularidade é uma qualidade quando se ouve uma hora.

A mesma voz em várias línguas

Um tutorial em português, em espanhol e em japonês com a mesma voz: o ElevenLabs e o MiniMax guardam o timbre de uma língua para a outra. O node lê a língua do texto, basta traduzir o guião.

Um diálogo a duas vozes

Duas personagens que se respondem: o node de Voz off propõe um modo diálogo no ElevenLabs, uma voz por fala. O fluxo avatar falante vai mais longe, com um rosto que fala.

Uma voz para um atendedor ou um guia

Uma mensagem de boas-vindas, um aviso em loja, um guia áudio de museu: textos curtos, lidos centenas de vezes. O preço por leitura decide, e é o motor por defeito que ganha.

Erros frequentes

Julgar pela primeira frase

Todos os motores leem bem uma frase simples. As diferenças fazem-se no nome próprio, no número, na enumeração e na frase longa. É por isso que o guião da demo contém um de cada.

Escrever para o olho, não para o ouvido

Um texto escrito para ser lido lê-se mal em voz alta: frases demasiado longas, parênteses, abreviaturas. Diga-o a si próprio antes de o dar ao motor, e corte as frases em duas.

Deixar os algarismos em algarismos

«1 500 € em 2024» lê-se de três maneiras diferentes consoante o motor. Escreva «mil e quinhentos euros em dois mil e vinte e quatro» e os três lerão a mesma coisa.

Mudar de motor antes de mudar de voz

Cada motor tem muitas vozes. Uma voz demasiado grave ou demasiado rápida não é o motor, é a afinação: experimente duas vozes e a velocidade antes de concluir.

Modelos recomendados

Perguntas frequentes

Qual dos três escolher?

O ElevenLabs v3 para um texto interpretado, publicidade, ficção, tudo o que precise de intenção. O MiniMax para uma narração natural e longa, documentário ou tutorial. O OpenAI para o volume: dezenas de leituras regulares a baixo preço.

Posso usar a minha própria voz?

Não neste fluxo, que compara as vozes dos motores. O node de Voz off aceita uma voz de referência nalguns motores; isso é outra página, e outra pergunta, a do consentimento.

Em que línguas funciona?

Nas catorze línguas do site no ElevenLabs e no MiniMax, incluindo japonês, árabe e hebraico. O OpenAI também lê a maioria, com um sotaque mais marcado fora do inglês. O node escolhe a língua do texto.

Quanto custa uma voz off?

O guião da demo, duzentos e trinta caracteres, custa sete créditos no ElevenLabs, sete no MiniMax e três no OpenAI, dezassete pelos três. O preço segue o comprimento do texto e aparece em cada node antes do clique.

Qual é o comprimento máximo do texto?

Vários milhares de caracteres por node, o limite exato depende do motor e aparece no node. Um texto longo corta-se em parágrafos, um node por parágrafo, o que também permite relançar só o que se corrige.

Posso regular a emoção ou a velocidade?

A velocidade nos três. A emoção no MiniMax por uma regulação do node, no ElevenLabs v3 por etiquetas escritas no próprio texto, entre parênteses retos. O OpenAI lê tal e qual.

Posso fazê-lo a partir do telemóvel?

Sim, a tela funciona no telemóvel e o texto escreve-se diretamente no node. O guia criar no telemóvel explica os gestos da tela com o dedo.

O ficheiro é de uso livre?

Sim, a voz gerada é sua, tanto para um vídeo público como para uso comercial. As vozes dos motores são vozes sintéticas licenciadas, não pessoas reais.

Voz off IA: o mesmo texto lido por três motores

Usar este workflow

Conta gratuita, sem cartão. O workflow abre-se pré-preenchido no seu canvas.