Crear el extracto de audio de un libro con IA

El capítulo en PDF arrastrado al lienzo: un node Texto copia su apertura palabra por palabra, una voz de narrador ElevenLabs la lee, una base instrumental suena por debajo, y la portada permanece en pantalla en un Montaje 16:9: el vídeo listo para publicar y hacer escuchar el primer capítulo. Todo el flujo de trabajo se ve sin cuenta.

El primer capítulo de la novela original, un PDF arrastrado al node MediaDemo interactiva

Workflow real, resultados reales. Muévete y haz zoom libremente.

Usar este workflow

El flujo de trabajo real: el primer capítulo de una novela en PDF en un node Media, Claude Sonnet 5 copiando la apertura, ElevenLabs v3 para la narración, ElevenLabs Music para la base, GPT Image 2.5 Flare para la portada, un node Montaje. Los textos mostrados son las respuestas de los modelos, sin retoques.

En resumen

Usted proporciona
1 PDF · un texto o un briefing
Lo que produce el workflow
1 imagen en 3:4 · 1 pista de audio de 60 s en total · 1 voz en off
Estructura del canvas
8 nodes conectados por 6 enlaces
Modelos conectados
Claude Sonnet 5, ElevenLabs v3, ElevenLabs Music, GPT Image 2.5 Flare
Coste de una pasada completa
unos 97 créditos, es decir 1,16 US$
Cuenta
La demo se puede ver sin cuenta; generar requiere una cuenta gratuita, con créditos de prueba incluidos

Hacer escuchar el primer capítulo es la mejor publicidad de un libro. El PDF entra en un node Media, y un node Texto lo lee por su puerto «Imagen o PDF a analizar» para copiar la apertura palabra por palabra, sin reescribir nada, hasta el final de un párrafo antes de 1.400 caracteres: la duración de una lectura de un minuto y medio.

El node Voz en off lee ese texto conectado con ElevenLabs v3, una voz de narrador elegida de la lista. El node Música compone sesenta segundos de base instrumental a partir de un brief conectado, en bucle en el Montaje a volumen bajo. El node Imagen dibuja la portada con el título en GPT Image 2.5 Flare, y el Montaje la mantiene entera, sobre fondo negro, durante toda la narración.

La demo lee la apertura de «North of Silence», una novela original escrita para el ejemplo. Sustituya el PDF por su capítulo, la voz en el node, el título en el prompt de la portada. Un capítulo entero se lee en varios nodes Voz en off de 3.000 caracteres, unidos uno tras otro en el Montaje. La portada y el tráiler completan la serie.

Resultados reales de la demo

Estos son los archivos del flujo de trabajo anterior, tal como los produjeron los modelos, sin retoques. El punto de partida se indica cuando existe.

Resultado

La narración de la apertura del capítulo, leída por ElevenLabs v3 con la voz GeorgeGenerado con ElevenLabs v3
La base instrumental de sesenta segundos compuesta por ElevenLabs Music, en bucle bajo la vozGenerado con ElevenLabs Music
La portada con el título, dibujada por GPT Image 2.5 Flare, mostrada entera en el MontajeGenerado con GPT Image 2.5 Flare
El extracto montado: la portada en pantalla, la narración y la base, listo para publicar

Para quién es

Autores y editores que quieren hacer escuchar un primer capítulo sin estudio ni actor de voz, o probar una voz antes de un audiolibro completo.

Qué archivos proporcionar

Un capítulo en PDF de texto, no un escaneo: el node Texto copia la prosa tal cual y la voz la lee frase por frase.

Cómo hacerlo

  1. 1

    Arrastre el capítulo en PDF

    Un node Media lo recibe. El node Texto copia la apertura, no un resumen: es su prosa la que se lee, frase por frase, hasta el final de un párrafo.

  2. 2

    Elija la voz y lea

    El node Voz en off recibe el texto por cable. Una veintena de timbres ElevenLabs v3, o una voz clonada: la demo usa George, un narrador sereno. Una etiqueta [pause] o [whispers] en el texto guía la interpretación.

  3. 3

    Componga la base y dibuje la portada

    El node Música compone sesenta segundos a partir del brief conectado, instrumental. El node Imagen escribe el título en la portada en 3:4, dos créditos. Ambos pueden rehacerse sin tocar la narración.

  4. 4

    Monte y publique

    El Montaje coloca la portada entera sobre fondo negro en 16:9, la narración en una pista, la base en bucle a volumen bajo en la otra, con un fundido final. Renderizado en el navegador, sin créditos, exportado en mp4.

Variantes y casos de uso

El mismo canvas, ajustado a necesidades distintas: cada variante son dos o tres líneas de prompt que cambiar.

El extracto del primer capítulo

Esta es la demo: la apertura copiada palabra por palabra, una voz de narrador, una base, la portada en pantalla. Sustituya el PDF y el título, conserve el resto, y el vídeo se rehace para su libro.

El capítulo completo en varias tomas

Un node Texto por cada tramo de 3.000 caracteres, un node Voz en off por cada uno, todos en el mismo Montaje: un capítulo de quince minutos se lee en unos diez nodes, con la base en bucle debajo.

El extracto leído por el autor

Clone su voz en un node Voz en off a partir de un minuto de grabación, y luego elíjala para la narración: el primer capítulo lo lee usted, sin estudio.

La versión pódcast, sin imagen

Retire el node Imagen y el Montaje: la narración y la base se exportan en mp3 desde los nodes, para una plataforma de pódcast o la página del libro.

El extracto en varios idiomas

Pida al node Texto que traduzca el tramo, ajuste el idioma del node Voz en off, conserve la portada: el mismo vídeo existe en inglés, en español, en alemán, con la misma voz.

Errores frecuentes

Un resumen en lugar del texto

La instrucción indica copiar la prosa exactamente. Si el modelo resume, es que leyó un PDF escaneado sin texto: convierta el manuscrito en un PDF de texto, no en imágenes de páginas.

Una base que tapa la voz

La música está a 0,25 en el Montaje para quedar por debajo de la narración. Una base con una melodía marcada atrae el oído: pida al brief un fondo sin tema melódico, sin percusión.

La portada recortada

El Montaje está ajustado para contener la imagen entera sobre fondo negro. En modo cubrir, una portada 3:4 pierde el título arriba y abajo: mantenga contener para un extracto.

Modelos recomendados

Preguntas frecuentes

¿Se puede leer un capítulo entero?

Sí, por tramos: un node Voz en off lee hasta 3.000 caracteres. Pida al node Texto el siguiente tramo, duplique el node Voz en off, y coloque los tramos uno tras otro en el Montaje. El precio depende de los caracteres leídos.

¿Cuánto cuesta el extracto?

Unos sesenta créditos para la demo: la narración de 1.400 caracteres (una docena de créditos), la base de sesenta segundos (unos cincuenta), la portada (dos) y la lectura del PDF (dos o tres). El precio se muestra en cada node antes de hacer clic.

¿La voz respeta la puntuación?

Sí: ElevenLabs v3 marca las comas, los puntos y los párrafos separados por una línea en blanco. Para una pausa más larga, la etiqueta [pause]; para un susurro, [whispers]. Las etiquetas no se leen en voz alta.

¿Qué duración debe tener un extracto?

De un minuto y medio a dos minutos, es decir, de 1.400 a 1.800 caracteres: suficiente para presentar una voz y una escena, lo bastante corto para escucharse entero en un teléfono.

¿Se puede cambiar la voz después?

Sí, en el node Voz en off, sin regenerar el texto: elija otro timbre y vuelva a ejecutar la lectura, el Montaje se actualiza.

¿Hace falta una portada?

No, cualquier clip de imagen sirve para el Montaje: una foto del autor, una ilustración del lugar. La portada con el título sigue siendo lo que mejor se comparte.

¿Dónde se publica el vídeo?

En la página del libro, en redes sociales, como episodio cero de un pódcast: el mp4 sale en 16:9, 1080p, con el sonido mezclado. Un Montaje en 9:16 crea la versión vertical.

Crear el extracto de audio de un libro con IA

Usar este workflow

Cuenta gratuita, sin tarjeta bancaria. El workflow se abre ya rellenado en tu canvas.