Todas las herramientas

Crear un pódcast a dos voces con IA

Un intercambio de ocho réplicas entre dos presentadores, interpretado en una sola toma por ElevenLabs Dialogue v3: dos voces, los relevos, las risas. El flujo completo, visible sin cuenta, con el episodio.

Demo interactiva

Workflow real, resultados reales. Muévete y haz zoom libremente.

Usar este workflow

Flujo real: un solo nodo Voz en off en modo diálogo, ocho réplicas, una voz por réplica, sobre ElevenLabs Dialogue v3. Escucha el episodio.

En resumen

Lo que produce el workflow
1 voz en off
Estructura del canvas
2 nodes conectados por 0 enlaces
Modelos conectados
ElevenLabs Dialogue v3
Coste de una pasada completa
unos 7 créditos, es decir 0,08 US$

Un pódcast a dos voces no se fabrica pegando dos voces en off una tras otra: los silencios entre réplicas suenan falsos, los relevos son demasiado limpios, nadie ríe en el momento justo. ElevenLabs Dialogue v3 recibe todas las réplicas juntas e interpreta el intercambio en una sola toma, como dos personas en la misma sala. La demo dura un minuto, sobre una pregunta sencilla: por qué el tiempo pasa más rápido cuando envejecemos.

Todo cabe en un nodo Voz en off en modo diálogo. Cada réplica tiene su voz, elegida entre las veintiuna del modelo; la demo toma una femenina y una masculina, porque dos voces parecidas suenan a monólogo. Las etiquetas entre corchetes, [laughs], [curious], [whispers], dirigen la actuación sin leerse: la quinta réplica de la demo empieza con [laughs], y se oye.

Diez réplicas como máximo por nodo, tres mil caracteres. Para un episodio más largo, encadena varios nodos y júntalos en el nodo Montaje. El modelo se factura por carácter: cuenta una docena de créditos por minuto de habla. Una hora de pódcast sale por menos de doce dólares.

Cómo hacerlo

  1. 1

    Escribe el intercambio, réplica a réplica

    Frases cortas, como se habla. Una réplica por idea. Haz que respondan, que insistan, que corten: el ida y vuelta hace el pódcast, no la longitud de los discursos.

  2. 2

    Da una voz a cada réplica

    Una femenina, una masculina, de timbres alejados. La misma voz para el mismo presentador de principio a fin. El nodo propone la lista, escucha dos antes de elegir.

  3. 3

    Coloca las etiquetas de actuación

    [laughs] antes de una réplica divertida, [curious] antes de una pregunta, [sighs] antes de una concesión. Una etiqueta por réplica como máximo, el modelo hace el resto.

  4. 4

    Genera, escucha, corrige una réplica

    El nodo interpreta el intercambio entero. Si una réplica suena mal, cambia su texto o su etiqueta y relanza: el modelo lo vuelve a interpretar todo, coherente de principio a fin.

Variantes y casos de uso

El mismo canvas, ajustado a necesidades distintas: cada variante son dos o tres líneas de prompt que cambiar.

Un pódcast de empresa sin estudio

Un guion por episodio, dos voces fijas, un minuto por nodo. El montaje junta los nodos, añade un jingle y una música. Sin micrófono, sin sala, sin toma fallida.

Un artículo resumido en conversación

Haz que una voz pregunte y la otra responda: un artículo del blog se convierte en un intercambio de cinco minutos que se escucha caminando. El modelo de texto del lienzo puede escribir el guion.

Un diálogo de formación o de clase

El profesor y el alumno, el cliente y el asesor, el paciente y el médico. Dos voces, etiquetas de duda, y el caso cobra vida. Cada escenario en su nodo.

Una escena de ficción sonora

Dos personajes, etiquetas de emoción, [whispers], [sad], [excited], y un efecto de sonido generado bajo la escena. El nodo Montaje pone las voces sobre el ambiente.

Un anuncio de audio a dos voces

Treinta segundos, una pregunta y una respuesta, la marca en la última réplica. La voz femenina y la masculina se reparten los papeles, el montaje añade la música.

El episodio, luego limpio y publicado

El archivo sale limpio; si hay que suavizar un nivel, el nodo Mejorar se encarga. El MP3 se descarga desde el nodo, listo para la plataforma de pódcast.

Errores frecuentes

Dos voces que se parecen

Dos voces femeninas de la misma edad, o dos masculinas graves: ya no se sabe quién habla. Toma una voz de cada timbre, como hace la demo, y consérvalas de un episodio a otro.

Discursos en vez de réplicas

Una réplica de doscientas palabras ya no es un intercambio, es una conferencia. Corta, haz que la otra voz retome. El ritmo de un pódcast viene del ida y vuelta.

Demasiadas etiquetas

Una etiqueta por réplica dirige la actuación; cuatro la caricaturizan. [laughs] en cada línea acaba sonando falso. La demo usa dos en ocho réplicas.

Pasar de las diez réplicas

El nodo acepta diez y tres mil caracteres, para que el modelo mantenga la coherencia del intercambio. Más allá, divide en varios nodos y júntalos en el montaje.

Modelos recomendados

Preguntas frecuentes

¿Las dos voces se responden de verdad?

Sí. El modelo recibe las réplicas juntas y gestiona los relevos, las respiraciones y el ritmo del intercambio. Esa es la diferencia con dos voces en off unidas en el montaje.

¿Puedo usar mi propia voz?

Aquí no. El modelo tiene veintiuna voces, no clona. Para leer un texto con una voz que se parezca a la tuya, el flujo cambiar de voz vuelve a interpretar tu grabación con otro timbre.

¿En qué idioma?

En el de tus réplicas, en los catorce idiomas del sitio. El idioma se ajusta en el nodo; la demo está en español, con voces que saben pronunciarlo.

¿Cuánto cuesta un episodio?

El precio se calcula por carácter y aparece en el nodo antes de hacer clic, una docena de créditos por minuto de habla. El intercambio de la demo, mil caracteres, cuesta catorce. Una hora de pódcast sale por menos de doce dólares.

¿Cuántas voces distintas?

Veintiuna, femeninas y masculinas, todas capaces de hablar los catorce idiomas del sitio. Un diálogo puede mezclar más de dos, pero dos bastan para un pódcast.

¿Cuál es la duración máxima de un nodo?

Tres mil caracteres, unos tres minutos de habla. Un episodio de veinte minutos son siete nodos encadenados en el nodo Montaje, cada uno relanzable por separado.

¿Puedo añadir música y un jingle?

Sí, en el mismo lienzo: un nodo Música para la sintonía, y el nodo Montaje para poner las voces encima. El flujo sonorizar un vídeo muestra el principio.

¿Se puede hacer desde el móvil?

Sí. El lienzo funciona en el móvil, las réplicas se escriben en el nodo y el episodio se escucha dentro. La guía crear desde el móvil explica los gestos.

Crear un pódcast a dos voces con IA

Usar este workflow

Cuenta gratuita, sin tarjeta bancaria. El workflow se abre ya rellenado en tu canvas.