Todas as ferramentas

Separar a voz de uma música com IA

Uma música de 30 segundos separada em quatro faixas pelo Demucs, voz, bateria, baixo e resto, e a mesma música passada pelo isolamento vocal ao lado. O fluxo completo, sem criar conta.

Demo interativa

Workflow real, resultados reais. Desloque-se e faça zoom livremente.

Usar este workflow

O fluxo real: a mesma música entra em dois nodes Melhorar um som, o Demucs devolve quatro faixas, o isolamento devolve uma.

Em resumo

O que o workflow produz
5 ficheiros áudio processados
Estrutura do canvas
3 nodes ligados por 0 ligações
Modelos ligados
Demucs, ElevenLabs Audio Isolation
Custo de uma passagem completa
cerca de 12 créditos, ou seja US$ 0,14

Fazer um karaoke, isolar a voz para um remix, tirar a bateria de um tema para tocar por cima: tudo parte da mesma operação, separar uma música nas suas faixas. Este fluxo fá-lo com o Demucs, o modelo de separação da Meta: a música entra num node Melhorar um som e saem quatro ficheiros, a voz, a bateria, o baixo e tudo o resto, guitarras e teclados incluídos.

O segundo node faz outra coisa de propósito. O ElevenLabs Audio Isolation foi feito para a fala, não para a música, e a demo mostra o que faz com uma música mesmo assim: devolve a voz sozinha. Medido a 3 de setembro de 2026 na música da demo, a sua envolvente segue a faixa de voz do Demucs com 0,93 de correlação e 17 % mais de nível. Mas só devolve isso: sem instrumental, logo sem karaoke.

A música da demo é gerada, para não ter de pedir direitos a ninguém. A sua entra pelo botão de importar de cada node, até dez minutos por passagem, e o preço conta-se ao segundo: os dois nodes sobre trinta segundos custam catorze cêntimos, dos quais quatro créditos vão para o Demucs.

Como fazer

  1. 1

    Importe a sua música

    MP3, WAV, M4A ou OGG, até dez minutos. O node mostra a duração assim que o leitor a leu, e o preço com ela. A porta de áudio também aceita uma música gerada na tela.

  2. 2

    Lance o Demucs

    Um clique, quatro ficheiros: voz, bateria, baixo, outros. Cada faixa tem o seu leitor e o seu botão de transferência, e a saída do node leva a primeira, a voz.

  3. 3

    Compare com o isolamento

    O segundo node dá a voz sozinha por outro caminho. Numa voz muito produzida, um ou outro guarda melhor os fins de frase: ouça os dois antes de escolher qual mandar para a montagem.

  4. 4

    Monte a sua versão

    O karaoke são as três faixas sem a voz: ponha-as em três faixas de áudio da [Montagem](/docs/canvas-nodes) e exporte. Para um remix, guarde a voz e substitua o resto.

Variantes e casos de uso

O mesmo canvas, afinado para necessidades diferentes: cada variante são duas ou três linhas de prompt a mudar.

Uma versão karaoke

O caso mais pedido: a música sem a sua voz. O Demucs põe a voz de lado, o karaoke é o que fica, bateria, baixo e outros. Três faixas para pôr na montagem, e uma música para cantar por cima.

Um a cappella para um remix

O inverso: a voz sozinha, para pôr numa produção nova. Aqui os dois nodes competem, e é esse o sentido da demo: o Demucs e o isolamento devolvem cada um uma voz um pouco diferente, fique com aquela cujos fins de frase aguentam melhor.

Tocar a bateria de um tema

Um baterista que quer aprender um tema isola a faixa de bateria e ouve-a em loop, sem a guitarra por cima. O baixo funciona igual. São as duas faixas que o Demucs separa com mais limpeza.

Limpar uma versão gravada com o telemóvel

Uma versão filmada numa sala tem a voz e a guitarra misturadas. Extraia o áudio do vídeo, passe-o pelo Demucs, e a voz pode ser remisturada à parte, mais alta, antes de voltar às imagens.

Isolar um único instrumento

O Demucs só conhece quatro famílias. Para tirar exatamente uma guitarra ou um piano, o node SAM Audio recebe uma descrição em texto, «the electric guitar», e devolve o que reconheceu de um lado e o resto do outro.

Legendar ou transcrever uma música

Uma voz separada transcreve-se muito melhor do que uma mistura: as palavras deixam de lutar com a tarola. Separe primeiro, transcreva depois, e guarde a faixa de voz para verificar uma palavra duvidosa.

Erros frequentes

Pedir um karaoke ao isolamento vocal

Devolve a voz, nunca o contrário. O node diz «isolamento», e é exatamente o que faz: o que não é voz é deitado fora, não posto de lado. Para o karaoke, é o Demucs.

Separar um ficheiro já muito comprimido

Um MP3 a 96 kb/s ou uma música gravada a partir de uma coluna já perdeu os agudos que o Demucs usa para reconhecer os instrumentos. As faixas saem desfocadas. Parta do melhor ficheiro disponível, o original se possível.

Passar dez minutos para guardar trinta segundos

O preço conta-se ao segundo, e o Demucs é lento nos ficheiros longos. Corte primeiro para a passagem que lhe interessa e separe depois: é mais barato, mais rápido, e o resultado é o mesmo.

Esperar uma faixa «guitarra»

O Demucs arruma em «outros» tudo o que não é voz, bateria nem baixo: guitarras, teclados, cordas, juntos. Para um instrumento preciso é o node SAM Audio descrito acima, não uma quinta faixa que não existe.

Modelos recomendados

Perguntas frequentes

Qual dos dois nodes faz o karaoke?

O Demucs, e só ele. O karaoke é tudo o que não é a voz, ou seja, as faixas bateria, baixo e outros juntas. O isolamento vocal só devolve a voz, portanto não pode produzir o contrário.

A voz separada está limpa?

Limpa ao ouvido, não perfeita à lupa. Nos coros e nas reverberações longas, o Demucs deixa por vezes um sopro do resto da mistura na faixa de voz. Num remix afoga-se sob os novos instrumentos; para um a cappella nu, ouça os silêncios.

Posso separar um tema protegido?

Tecnicamente sim, o modelo não lê os direitos. O que faz com o resultado depende da licença do tema: um karaoke para casa não levanta questões, uma publicação levanta. A música da demo é gerada precisamente por isso.

Quanto custa uma separação?

Quatro créditos por trinta segundos com o Demucs, seis por minuto, uns sessenta pelos dez minutos máximos. O isolamento vocal é mais caro, catorze créditos por minuto. O preço aparece no node antes do clique, sobre a duração medida do seu ficheiro.

Qual é a duração máxima?

Dez minutos por passagem, para os dois nodes. Um álbum inteiro trata-se tema a tema, que é de qualquer forma o que quer: um conjunto de faixas por música.

Em que formato sai?

Ficheiros áudio legíveis em qualquer programa, um por faixa, transferíveis a partir do node. Cada faixa tem a duração exata da música original, sobrepõem-se sem desfasamento.

Posso fazê-lo a partir do telemóvel?

Sim, a tela funciona no telemóvel e o ficheiro escolhe-se a partir do node, inclusive dos ficheiros do telefone. O guia criar no telemóvel explica os gestos da tela com o dedo.

Os meus ficheiros servem para treinar modelos?

Não. O que importa fica no seu espaço e não é entregue a nenhum treino. Os ficheiros produzidos são seus, dentro dos direitos do tema original.

Separar a voz de uma música com IA

Usar este workflow

Conta gratuita, sem cartão. O workflow abre-se pré-preenchido no seu canvas.