🏆 Desempenho de separação de classe mundial

Separe vocais, falantes e música
Grátis, online, em segundos

Tinha música tocando durante a gravação? Ruído indesejado ao fundo? Solte qualquer arquivo de áudio ou vídeo abaixo e a Perso Dubbing separa em vocais, falantes individuais e música de fundo, para você ouvir cada faixa antes de criar uma conta.

Sem cadastro · Primeiros 60 segundos grátis · Os arquivos nunca são armazenados

Separação de áudio

Clique ou arraste e solte seu arquivo

A separação começa na hora — sem conta (até 200MB)

mp4movwebm wavmp3m4a

Não tem um arquivo? Experimente uma amostra:

Separando faixas de áudio...

Analisando as frequências de som para separar a voz dos elementos de fundo

No espaço de trabalho, você edita o script de cada locutor linha a linha

Seu arquivo tem mais de 60 segundos — separamos o primeiro minuto para você avaliar a qualidade. Entre para processar o arquivo completo
Baixar todos os arquivos
Áudio de fundo
Fundo (.wav)
Fundo com reações (.wav)new
Áudio dos falantes
Todos os falantes (vozes) (.wav)
Falante 1 (.wav)
Falante 2 (.wav)
Benchmarks

Desempenho de classe mundial — medido, não prometido

Três benchmarks públicos padrão do setor: MUSDB18 para separação vocal, VoiceBank-DEMAND para remoção de ruído e o Open ASR Leaderboard para transcrição. Os mesmos datasets usados em todos os papers, contra motores nomeados, com dados por amostra publicados para qualquer um refazer os testes.

Separação vocal maior = melhor

MUSDB18 (vocals) · median SI-SDR
Perso Dubbing 🏆
10.67 dB
HTDemucs (Meta)
8.36 dB
LALAL.AI · MDX-Net
ainda não testado

Vencemos em 44 de 50 faixas — e quando perdemos, a diferença é de no máximo 0.66 dB.

Qualidade de remoção de ruído maior = melhor

VoiceBank-DEMAND · PESQ-WB
DeepFilterNet3
2.77
Perso Dubbing
2.64
ElevenLabs
2.38
Entrada com ruído (antes da limpeza)
1.70

O especialista DeepFilterNet3 lidera por pouco (2.77 contra 2.64) — ambos bem à frente do ElevenLabs.

Clareza da fala maior = melhor

VoiceBank-DEMAND · ESTOI
DeepFilterNet3
0.821
Perso Dubbing
0.817
ElevenLabs
0.769
Entrada com ruído (antes da limpeza)
0.747

Os dois primeiros estão praticamente empatados. O ElevenLabs torna a fala mais difícil de entender em metade das amostras — nós a melhoramos em 96%.

Fidelidade de clonagem de voz maior = melhor

30 falantes · 2 sistemas de clonagem · cos_sim
Original limpo (teto)
0.736
Perso Dubbing 🏆
0.674
ElevenLabs Audio Iso.
0.665
DeepFilterNet3
0.652

Primeiro lugar nos dois sistemas de clonagem testados — até dentro do próprio clonador do ElevenLabs. A barra listrada é o original limpo: o teto natural.

Precisão de transcrição (WER) menor = melhor

Open ASR Leaderboard · 8 configs · word error rate
Média de 8 benchmarks empate estatístico
Scribe v2 (ElevenLabs)
7.52%
Perso Dubbing
7.61%
Conteúdo com vários falantes (GigaSpeech)
Perso Dubbing 🏆
10.70%
Scribe v2 (ElevenLabs)
11.48%
Whisper large-v3
ainda não testado

No geral, empate estatístico com o Scribe v2 — mas em conteúdo com vários falantes, como podcasts, saímos na frente (barra menor = menos erros).

As barras estão ampliadas para a faixa competitiva, para que pequenas diferenças permaneçam visíveis — o que vale é o número exato ao lado de cada barra.

O que esses testes realmente medem?

🎯 Separação vocal (SI-SDR) Quanto maior, melhor

Quão limpa é a separação entre voz e música — como extrair uma faixa de karaokê sem nenhum resquício de voz. Nossa pontuação: 10.67 dB contra 8.36 dB do HTDemucs — menos vazamento entre faixas, vencendo em 44 de 50 músicas.

🔊 Remoção de ruído (PESQ · ESTOI) Quanto maior, melhor

Quão clara e natural a fala soa depois da remoção do ruído — a mesma métrica usada para qualidade de chamadas. Marcamos 2.64, logo atrás do especialista DeepFilterNet3 (2.77) e bem à frente do ElevenLabs (2.38). Em clareza, empatamos em primeiro.

📝 Precisão de transcrição (WER) Quanto menor, melhor

De cada 100 palavras faladas, quantas são transcritas errado. Nossos 7.61% significam cerca de 92 em 100 palavras corretas — estatisticamente igual ao ElevenLabs Scribe v2 (7.52%) e à frente em gravações com vários falantes, como podcasts.

🎤 Fidelidade de clonagem de voz (cos_sim) Quanto maior, melhor

Depois da limpeza, um clone de voz criado com esse áudio ainda soa como a mesma pessoa? Pontuado de 0 a 1 em relação à voz original. Nosso 0.674 fica em primeiro nos dois sistemas de clonagem testados — inclusive dentro do próprio clonador do ElevenLabs.

Notas honestas: a separação vocal é medida no conjunto de amostras do MUSDB18 (nova rodada completa com MUSDB18-HQ em andamento, esperada dentro de ±0.5 dB). O DeepFilterNet3 nos supera em PESQ por 0.15 — empatamos em clareza e lideramos em fidelidade de forma de onda (+18.66 contra +17.31 dB SI-SDR). MDX-Net e LALAL.AI ainda não foram testados, então não afirmamos vencer todos os separadores. Verificado em maio de 2026.

Resumo: em benchmarks públicos, nosso motor separou vozes com mais limpeza que o HTDemucs da Meta em 44 de 50 músicas, igualou o especialista em remoção de ruído DeepFilterNet3 e superou o ElevenLabs Audio Isolation em 92–100% das amostras. Ele até cria clones de voz melhores dentro do próprio sistema de clonagem do ElevenLabs do que o pré-processador da própria ElevenLabs. Verificado em maio de 2026 — dados por amostra publicados para conferência.
Como funciona

Três passos, em menos de um minuto

STEP 1

Envie seu arquivo

Arraste e solte um arquivo de áudio ou vídeo — MP3, WAV, M4A, MP4, MOV ou WebM, até 200MB. Sem conta para os primeiros 60 segundos.

STEP 2

Ouça as faixas separadas

A IA divide seu arquivo em falantes individuais, música de fundo pura e fundo com reações. Reproduza cada faixa direto no navegador.

STEP 3

Exporte sua mixagem

Escolha as faixas que precisar e exporte tudo em um único arquivo. Entre para baixar ou processar arquivos longos por completo.

Por que Perso Dubbing

Muito além de um removedor de vocais

😂 Dois modos de áudio de fundo

BGM pura, ou BGM com risadas e aplausos intactos. Nenhuma outra ferramenta de separação oferece os dois com um único upload.

👤 Separação multifalante

Não é só voz contra música — a separação por falante dá a cada pessoa da gravação sua própria faixa, além de uma transcrição identificada em 99+ idiomas.

🔒 Nada fica armazenado

Arquivos de teste são processados em armazenamento temporário e apagados ao fim da sessão. Nunca guardados, nunca usados para treinamento.

📝 Transcrição em 99+ idiomas

Toda separação inclui conversão automática de fala em texto com identificação de falantes, exibida ao lado das suas faixas. A detecção de idioma é automática — sem ferramentas nem etapas extras.

🎬 Funciona com áudio e vídeo

Envie MP3, WAV, M4A, MP4, MOV ou WebM. Exporte faixas com legendas embutidas ou arquivos SRT separados.

🎚 Exportação de mixagem seletiva

Combine as faixas que quiser em um único arquivo — música de fundo mais Falante 1, por exemplo. Nenhuma outra ferramenta exporta uma mixagem personalizada em um passo.

Modo duplo de áudio de fundo

Remova a música de fundo ou o ruído do seu vídeo de duas formas

A risada de um podcast, a reação da plateia, uma tosse durante a palestra — a maioria dos removedores de vocais não distingue isso da fala. O Perso Dubbing oferece as duas opções com um único upload.

MODE 1

Música de fundo

Remove todo som humano — fala, risadas, palmas — deixando apenas o som de fundo. Ideal para BGM livre de direitos e bases limpas para redublagem.

🗣 FalaREMOVIDO
😂 Risadas / AplausosREMOVIDO
🎵 Música de fundoMANTIDO
MODE 2 · Only in Perso Dubbing

Fundo com reações

Remove apenas a fala, mantendo risadas, aplausos e a energia da plateia. Perfeito para podcasts, eventos ao vivo e programas em que a atmosfera importa.

🗣 FalaREMOVIDO
😂 Risadas / AplausosMANTIDO
🎵 Música de fundoMANTIDO
Separação multifalante

Uma faixa por voz — separação por falante para entrevistas, podcasts e reuniões

A maioria dos removedores de vocais para em dois stems: voz e música. A separação multifalante do Perso Dubbing vai além — a IA detecta quantas pessoas estão falando e divide a gravação em faixas individuais por falante, cada uma com uma transcrição identificada em 99+ idiomas.

INPUT

Uma gravação misturada

Uma gravação de entrevista, podcast ou reunião com várias pessoas falando sobre música e ruído ambiente — enviada como um único arquivo de áudio ou vídeo.

🎙 Falante 1 + Falante 2 + MúsicaMISTURADO
OUTPUT · Speaker separation

Uma faixa separada para cada falante

Separe os falantes do áudio com um clique: exporte a faixa de um único falante ou qualquer combinação que quiser — sem edição manual.

🎤 Falante 1FAIXA PRÓPRIA
🎤 Falante 2FAIXA PRÓPRIA
🎵 Música de fundoFAIXA PRÓPRIA
Casos de uso

Quem usa separação de áudio?

🛡 Resolução de copyright

Remova a BGM protegida mantendo o diálogo intacto, troque por música livre de royalties e reenvie sem reivindicações.

🎙 Edição de podcast

Corte vícios de linguagem e falas indesejadas mantendo as risadas da plateia e as reações ambientes intactas.

🌍 Dublagem de vídeo

Extraia uma BGM limpa, sem vazamento de voz, e aplique uma nova locução em qualquer um de mais de 99 idiomas.

💼 Reuniões e conferências

Separe os falantes do áudio em gravações do Zoom ou Meet — cada participante ganha sua própria faixa, com transcrições identificadas por falante incluídas.

📱 Clipes para redes sociais

Troque a BGM original dos seus vídeos curtos por uma faixa em alta — sem mexer na sua narração.

🎤 Shows e fancams

Remova o ruído da plateia e a reverberação do local em clipes ao vivo para isolar a voz do artista ou a música.

📰 Jornalismo e entrevistas

Use a separação multifalante para extrair a voz de cada entrevistado de gravações de campo ruidosas, com transcrições limpas para checagem.

♻️ Reaproveite conteúdo

Um único upload vira áudio de podcast, BGM promocional, clipes de falantes para redes sociais e uma transcrição completa para o blog.

Faça mais no espaço de trabalho da Perso

FAQ

Perguntas frequentes

O Perso Dubbing Audio Separation é gratuito?
Sim. Você pode enviar qualquer arquivo de áudio ou vídeo e separar os primeiros 60 segundos de graça, sem cadastro e sem cartão. Para baixar resultados ou processar arquivos com mais de 60 segundos, assine o Perso Dubbing. Os planos pagos ampliam os limites de processamento e adicionam edição de falantes.
Preciso criar uma conta para testar a separação de áudio?
Não. O teste de 60 segundos funciona totalmente sem conta. Envie um arquivo, ouça cada faixa separada no navegador e avalie se a qualidade atende. A conta só é necessária para baixar resultados ou processar arquivos mais longos.
O que acontece se meu arquivo tiver mais de 60 segundos?
Arquivos com mais de 60 segundos também são aceitos — a IA processa os primeiros 60 segundos para você avaliar a qualidade com o seu próprio conteúdo. Para separar o arquivo completo, entre e envie o arquivo novamente.
Meus arquivos ficam armazenados nos servidores da Perso Dubbing?
Não. Os uploads de teste são processados em armazenamento temporário e apagados automaticamente ao fim da sessão. A Perso Dubbing não guarda, reutiliza nem treina com arquivos enviados no teste gratuito.
Quais formatos e tamanhos de arquivo são aceitos?
O Perso Dubbing aceita arquivos de áudio MP3, WAV e M4A, além de vídeos MP4, MOV e WebM, até 200MB por upload. Vídeos são tratados automaticamente — a IA extrai o áudio e o separa.
Qual a diferença entre Música de fundo e Fundo com reações?
Música de fundo remove todo som gerado por humanos — fala, risadas, aplausos — e deixa apenas o som de fundo puro. Fundo com reações remove só a fala, mantendo risadas, aplausos e sons da plateia, preservando a atmosfera ao vivo de podcasts e eventos. O Perso Dubbing gera as duas faixas com um único upload.
O Perso Dubbing faz separação multifalante, não só voz e música?
Sim. Além da divisão voz/música, o Perso Dubbing faz separação completa por falante (também chamada de speaker split): a IA detecta cada falante da gravação e gera uma faixa por falante, junto com uma transcrição identificada em 99+ idiomas. Ideal para entrevistas, podcasts e reuniões, não só música.
Qual a precisão da separação do Perso Dubbing em relação a outras ferramentas?
No benchmark padrão MUSDB18, o Perso Dubbing separa vozes com mais limpeza que o HTDemucs da Meta em 44 de 50 faixas (10.67 contra 8.36 dB de SI-SDR mediano). Na remoção de ruído com VoiceBank-DEMAND, empata com o especialista DeepFilterNet3 e supera o ElevenLabs Audio Isolation em 92-100% das amostras. Os resultados por amostra são publicados para qualquer um conferir.
Posso remover música protegida por direitos autorais do meu vídeo?
Sim. Envie o vídeo, deixe a IA separar as faixas de áudio e exporte apenas as faixas de voz e falantes, sem a música de fundo. É o jeito mais rápido de resolver reivindicações de copyright no YouTube, TikTok ou Instagram sem regravar o conteúdo.
Como faço para tirar a música de fundo de um vídeo que eu gravei?
Envie o arquivo de vídeo direto, sem precisar extrair o áudio antes. A Perso Dubbing separa a fala, a música de fundo e o som ambiente em faixas individuais: exporte a mixagem só com a fala para tirar a música ou combine as faixas como quiser. Aceita MP4, MOV e WebM, e os primeiros 60 segundos são grátis.
Qual a diferença do Perso Dubbing para o LALAL.AI ou o Moises?
Ferramentas musicais separam vocais e instrumentos — e param por aí. O Perso Dubbing combina separação com transcrição em 99+ idiomas, reatribuição de falantes, dois modos de áudio de fundo e mixagem seletiva de faixas em um único fluxo, feito para criadores de vídeo e editores de conteúdo, não apenas músicos.
Posso combinar faixas selecionadas em um único arquivo?
Sim. Escolha qualquer combinação de faixas separadas — música de fundo mais Falante 1, por exemplo — e exporte como um único arquivo de áudio. Essa exportação de mixagem seletiva é exclusiva do Perso Dubbing.

Teste com o seu próprio arquivo — agora mesmo

Os primeiros 60 segundos são grátis. Sem cadastro, sem arquivos armazenados, sem pegadinha.

↑ Enviar um arquivo