Uma frase dita por uma voz de homem, repetida pelo ElevenLabs Voice Changer em três vozes, uma mulher, um homem jovem, um homem mais velho, com o ritmo e a entoação originais. O fluxo completo, sem criar conta.
Demo interativa
Workflow real, resultados reais. Desloque-se e faça zoom livremente.
O fluxo real: a mesma frase entra em três nodes Melhorar um som, cada um regulado numa voz de destino, e ouve o que muda e o que fica.
Em resumo
O que o workflow produz
3 ficheiros áudio processados
Estrutura do canvas
4 nodes ligados por 0 ligações
Modelos ligados
ElevenLabs Voice Changer
Custo de uma passagem completa
cerca de 27 créditos, ou seja US$ 0,32
Uma personagem para dobrar quando só se tem uma voz à mão, uma voz off que se quer mais grave ou mais jovem, uma mensagem de voz para tornar anónima: o modificador de voz faz tudo isso a partir de uma gravação comum. Este fluxo passa-a pelo ElevenLabs Voice Changer com três vozes de destino lado a lado, para ouvir de uma vez o que muda e o que guarda.
O que guarda é o essencial: o ritmo, as pausas, as hesitações, a entoação. O modificador não reescreve a frase, repete-a com outro timbre. A frase da demo tem uma pergunta, uma pausa e um remate, e as três vozes reproduzem-nos de forma idêntica. Não é síntese de voz: é a sua interpretação, noutra garganta.
Vinte e uma vozes ElevenLabs à escolha, e nenhuma voz pessoal: a ferramenta disfarça, não clona. O seu ficheiro entra pelo botão de importar do node, até dez minutos por passagem, ao segundo: a frase de doze segundos em três vozes custa trinta e dois cêntimos, nove créditos por voz.
Como fazer
1
Grave ou importe a frase
Uma nota de voz do telemóvel chega. Fale como quer que se fale: o modificador copia a interpretação, não as palavras. Uma captação limpa dá um resultado limpo; um fundo barulhento limpa-se antes.
2
Escolha uma voz de destino
Vinte e uma vozes, mulheres e homens, jovens e mais velhas, no seletor do node. Cada node leva a sua: três nodes sobre a mesma fonte, três candidatas para comparar.
3
Ouça o ritmo, não o timbre
O timbre será o da voz escolhida, isso é garantido. O que se avalia é a fidelidade da interpretação: a pausa antes do remate ainda lá está, a pergunta ainda sobe?
4
Envie para a montagem ou transfira
A saída do node liga-se à montagem ou a outro tratamento. Para uma dobragem, uma voz por personagem, cada uma no seu node.
Variantes e casos de uso
O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.
Dobrar várias personagens sozinho
Uma narrativa a três vozes, um diálogo, um podcast de ficção: interpreta todas as falas, uma voz de destino por personagem, um node por personagem. A interpretação é sua em todo o lado, só o timbre distingue os papéis.
Tornar um testemunho anónimo
Um testemunho que se quer difundir sem que a pessoa seja reconhecida. A voz muda por completo, a emoção e o ritmo ficam: é mais honesto do que uma voz abrandada ou deformada, e muito mais audível.
Uma voz off mais grave ou mais serena
A sua voz parece-lhe demasiado jovem ou aguda para uma narração: repita-a com o George ou o Roger. Guarda a sua dicção e os seus silêncios, ganha o timbre que não tem.
Uma mensagem de voz disfarçada para uma partida
O caso mais leve, e o mais frequente. Uma mensagem de aniversário dita por uma voz de criança ou de velho, com as suas palavras e os seus risos. Avise que é uma brincadeira: a voz convence.
Uma voz de assistente ou de mascote
Uma personagem de marca que fala em vídeos: grave as frases você mesmo, passe-as sempre pela mesma voz de destino, e a personagem guarda a sua voz de um vídeo para o outro.
O mesmo texto lido por uma máquina
Se não tem gravação nenhuma, é do fluxo voz off que precisa: gera a leitura a partir do texto. O modificador parte sempre de uma voz humana.
Erros frequentes
Esperar uma clonagem
O modificador não reproduz uma voz que se lhe dê como exemplo. Vinte e uma vozes, todas licenciadas pela ElevenLabs, nenhuma pessoa real. Querer «a voz de» alguém está fora do que a ferramenta faz, e fora do que deveria fazer.
Mudar uma voz sobre um fundo barulhento
O ruído não é transformado, é conservado tal e qual sob uma voz que, essa, mudou: o contraste torna-o mais audível do que antes. Limpar primeiro, mudar depois.
Falar de forma plana contando com a voz de destino
O modificador não interpreta por si: uma leitura monótona dá uma voz de destino monótona. Toda a interpretação tem de estar na gravação de partida, é ela que manda.
Passar uma música
O modificador é feito para a fala. No canto, às vezes segura a nota, muitas vezes não, e a música por trás sai estragada. Para uma música, é a separação em faixas que é precisa primeiro.
Não, e é uma escolha. O modificador repete a sua gravação com uma das vozes ElevenLabs licenciadas; não aprende uma voz nova nem reproduz a de uma pessoa real. Para disfarçar, sim; para imitar alguém, não.
A voz guarda o meu sotaque?
Guarda a sua pronúncia e a sua entoação, logo em grande parte o seu sotaque: o modificador não toca na forma de dizer as palavras, só no timbre. Um sotaque marcado continua marcado, noutra voz.
E se a gravação tiver ruído?
O ruído passa para a nova voz e ouve-se ainda mais, porque o timbre mudou e ele não. Limpe primeiro com o fluxo limpar uma gravação e depois mude a voz.
Quanto custa uma mudança de voz?
Quarenta e dois créditos por minuto, ao segundo. A frase da demo, doze segundos em três nodes, custa vinte e sete créditos, nove por voz. O preço aparece no node antes do clique, sobre a duração medida do seu ficheiro.
Qual é a duração máxima?
Dez minutos por passagem. Uma gravação longa corta-se em pedaços na montagem, o que também permite relançar só a passagem que se corrige.
Em que línguas funciona?
Em todas: o modificador não percebe as palavras, transforma o som. Uma frase em japonês ou em árabe sai em japonês ou em árabe, com a mesma pronúncia.
Posso fazê-lo a partir do telemóvel?
Sim, e é até o caso natural: uma nota de voz gravada no telemóvel, importada para o node a partir da tela móvel. O guia criar no telemóvel explica os gestos.
As minhas gravações servem para treinar modelos?
Não. O que importa fica no seu espaço e não é entregue a nenhum treino, e nenhuma voz é aprendida a partir dos seus ficheiros: o modificador só tem as suas vinte e uma vozes.