Um podcast de empresa sem estúdio
Um guião por episódio, duas vozes fixas, um minuto por nó. A montagem junta os nós, acrescenta um jingle e uma música. Sem microfone, sem sala, sem take falhado.
Uma troca de oito falas entre dois apresentadores, interpretada num único take pelo ElevenLabs Dialogue v3: duas vozes, as passagens, os risos. O fluxo completo, visível sem conta, com o episódio.
Workflow real, resultados reais. Desloque-se e faça zoom livremente.
Usar este workflowFluxo real: um só nó Voz off em modo diálogo, oito falas, uma voz por fala, no ElevenLabs Dialogue v3. Ouve o episódio.
Em resumo
Um podcast a duas vozes não se faz colando duas vozes off uma a seguir à outra: os silêncios entre falas soam falsos, as passagens são limpas demais, ninguém ri no momento certo. O ElevenLabs Dialogue v3 recebe todas as falas juntas e interpreta a troca num só take, como duas pessoas na mesma sala. A demo dura um minuto, sobre uma pergunta simples: porque é que o tempo passa mais depressa quando envelhecemos.
Tudo cabe num nó Voz off em modo diálogo. Cada fala tem a sua voz, escolhida entre as vinte e uma do modelo; a demo escolhe uma feminina e uma masculina, porque duas vozes parecidas soam a monólogo. As etiquetas entre parênteses retos, [laughs], [curious], [whispers], dirigem a interpretação sem serem lidas: a quinta fala da demo começa com [laughs], e ouve-se.
Dez falas no máximo por nó, três mil caracteres. Para um episódio mais longo, encadeia vários nós e junta-os no nó Montagem. O modelo é faturado ao carácter: conta com uma dúzia de créditos por minuto de fala. Uma hora de podcast fica por menos de doze dólares.
Escreve a troca, fala a fala
Frases curtas, como se fala. Uma fala por ideia. Faz responder, insistir, cortar: é o vaivém que faz o podcast, não o comprimento dos discursos.
Dá uma voz a cada fala
Uma feminina, uma masculina, de timbres afastados. A mesma voz para o mesmo apresentador do início ao fim. O nó propõe a lista, ouve duas antes de escolher.
Coloca as etiquetas de interpretação
[laughs] antes de uma fala divertida, [curious] antes de uma pergunta, [sighs] antes de uma concessão. Uma etiqueta por fala no máximo, o modelo faz o resto.
Gera, ouve, corrige uma fala
O nó interpreta a troca inteira. Se uma fala soar mal, muda o texto ou a etiqueta e relança: o modelo volta a interpretar tudo, coerente de uma ponta à outra.
O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.
Um guião por episódio, duas vozes fixas, um minuto por nó. A montagem junta os nós, acrescenta um jingle e uma música. Sem microfone, sem sala, sem take falhado.
Faz uma voz perguntar e a outra responder: um artigo de blogue torna-se uma troca de cinco minutos que se ouve a caminhar. O modelo de texto da tela pode escrever o guião.
O professor e o aluno, o cliente e o consultor, o paciente e o médico. Duas vozes, etiquetas de hesitação, e o caso ganha vida. Cada cenário no seu nó.
Duas personagens, etiquetas de emoção, [whispers], [sad], [excited], e um efeito sonoro gerado debaixo da cena. O nó Montagem põe as vozes sobre o ambiente.
Trinta segundos, uma pergunta e uma resposta, a marca na última fala. A voz feminina e a masculina dividem os papéis, a montagem acrescenta a música.
O ficheiro sai limpo; se for preciso alisar um nível, o nó Melhorar trata disso. O MP3 descarrega-se a partir do nó, pronto para a plataforma de podcast.
Duas vozes femininas da mesma idade, ou duas masculinas graves: já não se sabe quem fala. Escolhe uma voz de cada timbre, como a demo faz, e mantém-nas de um episódio para o outro.
Uma fala de duzentas palavras já não é uma troca, é uma conferência. Corta, faz a outra voz retomar. O ritmo de um podcast vem do vaivém.
Uma etiqueta por fala dirige a interpretação; quatro caricaturam-na. [laughs] em cada linha acaba por soar falso. A demo usa duas em oito falas.
O nó aceita dez e três mil caracteres, para que o modelo mantenha a coerência da troca. Para além disso, divide em vários nós e junta-os na montagem.
Sim. O modelo recebe as falas juntas e gere as passagens, as respirações e o ritmo da troca. É a diferença face a duas vozes off juntas na montagem.
Aqui não. O modelo tem vinte e uma vozes, não clona. Para ler um texto com uma voz parecida com a tua, o fluxo mudar de voz volta a interpretar a tua gravação com outro timbre.
Na das tuas falas, nas catorze línguas do site. A língua afina-se no nó; a demo está em português, com vozes que a sabem pronunciar.
O preço calcula-se ao carácter e aparece no nó antes de clicares, cerca de uma dúzia de créditos por minuto de fala. A troca da demo, mil caracteres, custa catorze. Uma hora de podcast fica por menos de doze dólares.
Vinte e uma, femininas e masculinas, todas capazes de falar as catorze línguas do site. Um diálogo pode misturar mais de duas, mas duas chegam para um podcast.
Três mil caracteres, cerca de três minutos de fala. Um episódio de vinte minutos são sete nós encadeados no nó Montagem, cada um relançável sozinho.
Sim, na mesma tela: um nó Música para o genérico, e o nó Montagem para pôr as vozes por cima. O fluxo sonorizar um vídeo mostra o princípio.
Sim. A tela funciona no telemóvel, as falas escrevem-se no nó e o episódio ouve-se lá dentro. O guia criar no telemóvel explica os gestos.
Criar um podcast a duas vozes com IA
Usar este workflowConta gratuita, sem cartão. O workflow abre-se pré-preenchido no seu canvas.