Todas las herramientas

Separar la voz de una canción con IA

Una canción de 30 segundos separada en cuatro pistas por Demucs, voz, batería, bajo y resto, y la misma canción pasada por el aislamiento vocal al lado. El flujo completo, sin crear cuenta.

Demo interactiva

Workflow real, resultados reales. Muévete y haz zoom libremente.

Usar este workflow

El flujo real: la misma canción entra en dos nodos Mejorar un sonido, Demucs devuelve cuatro pistas, el aislamiento devuelve una.

En resumen

Lo que produce el workflow
5 archivos de audio procesados
Estructura del canvas
3 nodes conectados por 0 enlaces
Modelos conectados
Demucs, ElevenLabs Audio Isolation
Coste de una pasada completa
unos 12 créditos, es decir 0,14 US$

Hacer un karaoke, aislar la voz para un remix, sacar la batería de un tema para tocarla encima: todo parte de la misma operación, separar una canción en sus pistas. Este flujo lo hace con Demucs, el modelo de separación de Meta: la canción entra en un nodo Mejorar un sonido y salen cuatro archivos, la voz, la batería, el bajo y todo lo demás, guitarras y teclados incluidos.

El segundo nodo hace otra cosa a propósito. ElevenLabs Audio Isolation está pensado para el habla, no para la música, y la demo muestra lo que hace con una canción de todos modos: devuelve la voz sola. Medido el 3 de septiembre de 2026 sobre la canción de la demo, su envolvente sigue la pista de voz de Demucs con una correlación de 0,93 y un 17 % más de nivel. Pero solo devuelve eso: sin instrumental, así que sin karaoke.

La canción de la demo está generada, para no tener que pedir derechos a nadie. La tuya entra por el botón de importar de cada nodo, hasta diez minutos por pasada, y el precio se cuenta por segundo: los dos nodos sobre treinta segundos cuestan catorce centavos, de los que cuatro créditos van a Demucs.

Cómo hacerlo

  1. 1

    Importa tu canción

    MP3, WAV, M4A u OGG, hasta diez minutos. El nodo muestra la duración en cuanto el reproductor la ha leído, y el precio con ella. El puerto de audio también acepta una música generada en el lienzo.

  2. 2

    Lanza Demucs

    Un clic, cuatro archivos: voz, batería, bajo, otros. Cada pista tiene su reproductor y su botón de descarga, y la salida del nodo lleva la primera, la voz.

  3. 3

    Compara con el aislamiento

    El segundo nodo da la voz sola por otro camino. En una voz muy producida, uno u otro conserva mejor los finales de frase: escucha los dos antes de elegir cuál mandar al montaje.

  4. 4

    Monta tu versión

    El karaoke son las tres pistas sin la voz: ponlas en tres pistas de audio del [Montaje](/docs/canvas-nodes) y exporta. Para un remix, guarda la voz y sustituye el resto.

Variantes y casos de uso

El mismo canvas, ajustado a necesidades distintas: cada variante son dos o tres líneas de prompt que cambiar.

Una versión karaoke

El caso más pedido: la canción sin su voz. Demucs aparta la voz, el karaoke es lo que queda, batería, bajo y otros. Tres pistas para poner en el montaje, y una canción para cantar encima.

Un a cappella para un remix

Lo contrario: la voz sola, para ponerla sobre una producción nueva. Aquí los dos nodos compiten, y ese es el sentido de la demo: Demucs y el aislamiento devuelven cada uno una voz un poco distinta, quédate con la que mejor aguante los finales de frase.

Tocar la batería de un tema

Un baterista que quiere aprender un tema aísla la pista de batería y la escucha en bucle, sin la guitarra encima. El bajo funciona igual. Son las dos pistas que Demucs separa con más limpieza.

Limpiar una versión grabada con el móvil

Una versión grabada en un salón tiene la voz y la guitarra mezcladas. Extrae el audio del vídeo, pásalo por Demucs, y la voz puede remezclarse aparte, más alta, antes de volver a ponerla sobre las imágenes.

Aislar un solo instrumento

Demucs solo conoce cuatro familias. Para sacar exactamente una guitarra o un piano, el nodo SAM Audio toma una descripción en texto, «the electric guitar», y devuelve lo que ha reconocido por un lado y el resto por otro.

Subtitular o transcribir una canción

Una voz separada se transcribe mucho mejor que una mezcla: las palabras ya no pelean con la caja. Separa primero, transcribe después, y guarda la pista de voz para comprobar una palabra dudosa.

Errores frecuentes

Pedirle un karaoke al aislamiento vocal

Devuelve la voz, nunca lo contrario. El nodo dice «aislamiento», y es exactamente lo que hace: lo que no es voz se tira, no se aparta. Para el karaoke, es Demucs.

Separar un archivo ya muy comprimido

Un MP3 a 96 kb/s o una canción grabada desde un altavoz ya ha perdido los agudos que Demucs usa para reconocer los instrumentos. Las pistas salen borrosas. Parte del mejor archivo disponible, el original si puedes.

Pasar diez minutos para quedarte con treinta segundos

El precio se cuenta por segundo, y Demucs es lento en los archivos largos. Corta primero al pasaje que te interesa y separa después: es más barato, más rápido y el resultado es el mismo.

Esperar una pista «guitarra»

Demucs mete en «otros» todo lo que no es voz, batería ni bajo: guitarras, teclados, cuerdas, juntos. Para un instrumento concreto está el nodo SAM Audio descrito arriba, no una quinta pista que no existe.

Modelos recomendados

Preguntas frecuentes

¿Cuál de los dos nodos hace el karaoke?

Demucs, y solo él. El karaoke es todo lo que no es la voz, es decir, las pistas de batería, bajo y otros juntas. El aislamiento vocal solo devuelve la voz, así que no puede producir lo contrario.

¿La voz separada está limpia?

Limpia al oído, no perfecta con lupa. En los coros y las reverberaciones largas, Demucs deja a veces un soplo del resto de la mezcla en la pista de voz. En un remix se ahoga bajo los nuevos instrumentos; para un a cappella desnudo, escucha los silencios.

¿Puedo separar un tema con derechos?

Técnicamente sí, el modelo no lee los derechos. Lo que hagas con el resultado depende de la licencia del tema: un karaoke para casa no plantea preguntas, una publicación sí. La canción de la demo está generada precisamente por eso.

¿Cuánto cuesta una separación?

Cuatro créditos por treinta segundos con Demucs, seis por minuto, unos sesenta por los diez minutos máximos. El aislamiento vocal es más caro, catorce créditos por minuto. El precio aparece en el nodo antes del clic, sobre la duración medida de tu archivo.

¿Cuál es la duración máxima?

Diez minutos por pasada, para los dos nodos. Un álbum entero se procesa tema a tema, que es de todos modos lo que quieres: un juego de pistas por canción.

¿En qué formato sale?

Archivos de audio legibles en cualquier programa, uno por pista, descargables desde el nodo. Cada pista tiene la duración exacta de la canción original, se superponen sin desfase.

¿Puedo hacerlo desde el móvil?

Sí, el lienzo funciona en móvil y el archivo se elige desde el nodo, incluso desde los archivos del teléfono. La guía crear desde el móvil explica los gestos del lienzo con el dedo.

¿Mis archivos sirven para entrenar modelos?

No. Lo que importas se queda en tu espacio y no se entrega a ningún entrenamiento. Los archivos producidos son tuyos, dentro de los derechos del tema original.

Separar la voz de una canción con IA

Usar este workflow

Cuenta gratuita, sin tarjeta bancaria. El workflow se abre ya rellenado en tu canvas.