Voz en off IA: el mismo texto leído por tres motores
El mismo guion leído por tres motores de síntesis de voz, ElevenLabs v3, MiniMax Speech 2.8 HD y OpenAI TTS HD, para elegir tu voz en off de oído. El flujo completo, sin crear cuenta.
Demo interactiva
Workflow real, resultados reales. Muévete y haz zoom libremente.
El flujo real: un nodo Texto lleva el guion, tres nodos de Voz en off lo leen cada uno con su motor, y tú escuchas.
En resumen
Lo que produce el workflow
3 voces en off
Estructura del canvas
5 nodes conectados por 3 enlaces
Modelos conectados
ElevenLabs v3, MiniMax Speech 2.8 HD, OpenAI TTS HD
Coste de una pasada completa
unos 17 créditos, es decir 0,20 US$
Una voz en off para un vídeo, un texto leído para un tutorial, una narración para un pódcast: la pregunta nunca es «se puede generar una voz» sino «cuál». Este flujo responde de oído. El guion vive en un nodo Texto y llega por cable a tres nodos de Voz en off, cada uno con un motor distinto: cambia una frase, vuelve a lanzar, los tres releen.
Los tres no están ahí por casualidad. ElevenLabs v3 es el más expresivo, interpreta las comas y los puntos, y es el más caro. MiniMax Speech 2.8 HD es el más natural, con un ligero acento en algunos nombres propios. OpenAI TTS HD es el motor por defecto del nodo, regular, la mitad de precio. Cada nodo ofrece sus propias voces, su velocidad y, en ElevenLabs, etiquetas de interpretación.
El guion de la demo dura unos quince segundos, con una coma, una enumeración y una palabra difícil, suficiente para oír la prosodia de cada uno. Las tres lecturas cuestan veinte centavos; el nodo lee el texto en los catorce idiomas del sitio.
Cómo hacerlo
1
Escribe el guion en el nodo Texto
Una puntuación cuidada hace la mitad del trabajo: los motores respiran en las comas y bajan la voz en los puntos. Escribe los números con letras cuando la lectura tenga que ser exacta.
2
Lanza las tres lecturas
«Generar todo» lanza los tres nodos de golpe. Cada nodo muestra su precio antes del clic, calculado sobre la longitud del texto.
3
Escucha el mismo pasaje
Compara en la frase más difícil, la del nombre propio o la enumeración. Ahí es donde los motores se separan, no en la primera frase.
4
Cambia la voz, no el motor
Cada motor tiene varias voces, y una voz que no encaja no condena al motor. Prueba dos o tres en el mismo nodo antes de cambiarlo.
Variantes y casos de uso
El mismo canvas, ajustado a necesidades distintas: cada variante son dos o tres líneas de prompt que cambiar.
Una voz en off para un vídeo de YouTube
El guion de un vídeo de diez minutos, leído de un tirón. MiniMax aguanta la duración sin cansar el oído; ElevenLabs es más vivo pero más caro en diez minutos. El flujo vídeo de YouTube sin cara continúa con las imágenes.
Un anuncio de veinte segundos
Veinte segundos en los que cada palabra cuenta: es el terreno de ElevenLabs v3, que acepta etiquetas de interpretación en el texto, una risa, un suspiro, un susurro. El flujo anuncio cinematográfico muestra la voz puesta sobre las imágenes.
Un texto leído para aprender
Una clase, un artículo, un capítulo para escuchar caminando. El motor por defecto basta y es el que menos cuesta: la regularidad es una virtud cuando se escucha una hora.
La misma voz en varios idiomas
Un tutorial en español, en francés y en japonés con la misma voz: ElevenLabs y MiniMax conservan el timbre de un idioma a otro. El nodo lee el idioma del texto, basta con traducir el guion.
Un diálogo a dos voces
Dos personajes que se responden: el nodo de Voz en off ofrece un modo diálogo en ElevenLabs, una voz por réplica. El flujo avatar que habla va más allá, con una cara que habla.
Una voz para un contestador o una guía
Un mensaje de bienvenida, un aviso en tienda, una audioguía de museo: textos cortos, leídos cientos de veces. Decide el precio por lectura, y gana el motor por defecto.
Errores frecuentes
Juzgar por la primera frase
Todos los motores leen bien una frase sencilla. Las diferencias aparecen en el nombre propio, el número, la enumeración y la frase larga. Por eso el guion de la demo contiene uno de cada.
Escribir para el ojo, no para el oído
Un texto escrito para ser leído se lee mal en voz alta: frases demasiado largas, paréntesis, abreviaturas. Dítelo a ti mismo antes de dárselo al motor, y parte las frases en dos.
Dejar las cifras en cifras
«1.500 € en 2024» se lee de tres formas distintas según el motor. Escribe «mil quinientos euros en dos mil veinticuatro» y los tres leerán lo mismo.
Cambiar de motor antes de cambiar de voz
Cada motor tiene muchas voces. Una voz demasiado grave o demasiado rápida no es el motor, es el ajuste: prueba dos voces y la velocidad antes de concluir.
ElevenLabs v3 para un texto interpretado, publicidad, ficción, todo lo que necesite intención. MiniMax para una narración natural y larga, documental o tutorial. OpenAI para el volumen: decenas de lecturas regulares a bajo precio.
¿Puedo usar mi propia voz?
No en este flujo, que compara las voces de los motores. El nodo de Voz en off acepta una voz de referencia en algunos motores; eso es otra página, y otra pregunta, la del consentimiento.
¿En qué idiomas funciona?
Los catorce idiomas del sitio en ElevenLabs y MiniMax, incluidos el japonés, el árabe y el hebreo. OpenAI también lee la mayoría, con un acento más marcado fuera del inglés. El nodo elige el idioma del texto.
¿Cuánto cuesta una voz en off?
El guion de la demo, doscientos treinta caracteres, cuesta siete créditos en ElevenLabs, siete en MiniMax y tres en OpenAI, diecisiete por los tres. El precio sigue la longitud del texto y aparece en cada nodo antes del clic.
¿Cuál es la longitud máxima del texto?
Varios miles de caracteres por nodo, el límite exacto depende del motor y aparece en el nodo. Un texto largo se parte en párrafos, un nodo por párrafo, lo que además permite relanzar solo el que se corrige.
¿Puedo ajustar la emoción o la velocidad?
La velocidad en los tres. La emoción en MiniMax mediante un ajuste del nodo, en ElevenLabs v3 mediante etiquetas escritas en el propio texto, entre corchetes. OpenAI lee tal cual.
¿Puedo hacerlo desde el móvil?
Sí, el lienzo funciona en móvil y el texto se escribe directamente en el nodo. La guía crear desde el móvil explica los gestos del lienzo con el dedo.
¿El archivo es de uso libre?
Sí, la voz generada es tuya, tanto para un vídeo público como para un uso comercial. Las voces de los motores son voces sintéticas con licencia, no personas reales.
Voz en off IA: el mismo texto leído por tres motores