Separe vocais, falantes e música
Grátis, online, em segundos
Tinha música tocando durante a gravação? Ruído indesejado ao fundo? Solte qualquer arquivo de áudio ou vídeo abaixo e a Perso Dubbing separa em vocais, falantes individuais e música de fundo, para você ouvir cada faixa antes de criar uma conta.
Sem cadastro · Primeiros 60 segundos grátis · Os arquivos nunca são armazenados
Clique ou arraste e solte seu arquivo
A separação começa na hora — sem conta (até 200MB)
Não tem um arquivo? Experimente uma amostra:
Separando faixas de áudio...
Analisando as frequências de som para separar a voz dos elementos de fundo
No espaço de trabalho, você edita o script de cada locutor linha a linha
Você atingiu o limite gratuito de hoje
Você usou as 3 separações grátis de hoje. Cadastre-se grátis para continuar.
O plano Starter remove o limite diário.
Desempenho de classe mundial — medido, não prometido
Três benchmarks públicos padrão do setor: MUSDB18 para separação vocal, VoiceBank-DEMAND para remoção de ruído e o Open ASR Leaderboard para transcrição. Os mesmos datasets usados em todos os papers, contra motores nomeados, com dados por amostra publicados para qualquer um refazer os testes.
Separação vocal maior = melhor
Vencemos em 44 de 50 faixas — e quando perdemos, a diferença é de no máximo 0.66 dB.
Qualidade de remoção de ruído maior = melhor
O especialista DeepFilterNet3 lidera por pouco (2.77 contra 2.64) — ambos bem à frente do ElevenLabs.
Clareza da fala maior = melhor
Os dois primeiros estão praticamente empatados. O ElevenLabs torna a fala mais difícil de entender em metade das amostras — nós a melhoramos em 96%.
Fidelidade de clonagem de voz maior = melhor
Primeiro lugar nos dois sistemas de clonagem testados — até dentro do próprio clonador do ElevenLabs. A barra listrada é o original limpo: o teto natural.
Precisão de transcrição (WER) menor = melhor
No geral, empate estatístico com o Scribe v2 — mas em conteúdo com vários falantes, como podcasts, saímos na frente (barra menor = menos erros).
As barras estão ampliadas para a faixa competitiva, para que pequenas diferenças permaneçam visíveis — o que vale é o número exato ao lado de cada barra.
O que esses testes realmente medem?
🎯 Separação vocal (SI-SDR) Quanto maior, melhor
Quão limpa é a separação entre voz e música — como extrair uma faixa de karaokê sem nenhum resquício de voz. Nossa pontuação: 10.67 dB contra 8.36 dB do HTDemucs — menos vazamento entre faixas, vencendo em 44 de 50 músicas.
🔊 Remoção de ruído (PESQ · ESTOI) Quanto maior, melhor
Quão clara e natural a fala soa depois da remoção do ruído — a mesma métrica usada para qualidade de chamadas. Marcamos 2.64, logo atrás do especialista DeepFilterNet3 (2.77) e bem à frente do ElevenLabs (2.38). Em clareza, empatamos em primeiro.
📝 Precisão de transcrição (WER) Quanto menor, melhor
De cada 100 palavras faladas, quantas são transcritas errado. Nossos 7.61% significam cerca de 92 em 100 palavras corretas — estatisticamente igual ao ElevenLabs Scribe v2 (7.52%) e à frente em gravações com vários falantes, como podcasts.
🎤 Fidelidade de clonagem de voz (cos_sim) Quanto maior, melhor
Depois da limpeza, um clone de voz criado com esse áudio ainda soa como a mesma pessoa? Pontuado de 0 a 1 em relação à voz original. Nosso 0.674 fica em primeiro nos dois sistemas de clonagem testados — inclusive dentro do próprio clonador do ElevenLabs.
Notas honestas: a separação vocal é medida no conjunto de amostras do MUSDB18 (nova rodada completa com MUSDB18-HQ em andamento, esperada dentro de ±0.5 dB). O DeepFilterNet3 nos supera em PESQ por 0.15 — empatamos em clareza e lideramos em fidelidade de forma de onda (+18.66 contra +17.31 dB SI-SDR). MDX-Net e LALAL.AI ainda não foram testados, então não afirmamos vencer todos os separadores. Verificado em maio de 2026.
Três passos, em menos de um minuto
Envie seu arquivo
Arraste e solte um arquivo de áudio ou vídeo — MP3, WAV, M4A, MP4, MOV ou WebM, até 200MB. Sem conta para os primeiros 60 segundos.
Ouça as faixas separadas
A IA divide seu arquivo em falantes individuais, música de fundo pura e fundo com reações. Reproduza cada faixa direto no navegador.
Exporte sua mixagem
Escolha as faixas que precisar e exporte tudo em um único arquivo. Entre para baixar ou processar arquivos longos por completo.
Muito além de um removedor de vocais
😂 Dois modos de áudio de fundo
BGM pura, ou BGM com risadas e aplausos intactos. Nenhuma outra ferramenta de separação oferece os dois com um único upload.
👤 Separação multifalante
Não é só voz contra música — a separação por falante dá a cada pessoa da gravação sua própria faixa, além de uma transcrição identificada em 99+ idiomas.
🔒 Nada fica armazenado
Arquivos de teste são processados em armazenamento temporário e apagados ao fim da sessão. Nunca guardados, nunca usados para treinamento.
📝 Transcrição em 99+ idiomas
Toda separação inclui conversão automática de fala em texto com identificação de falantes, exibida ao lado das suas faixas. A detecção de idioma é automática — sem ferramentas nem etapas extras.
🎬 Funciona com áudio e vídeo
Envie MP3, WAV, M4A, MP4, MOV ou WebM. Exporte faixas com legendas embutidas ou arquivos SRT separados.
🎚 Exportação de mixagem seletiva
Combine as faixas que quiser em um único arquivo — música de fundo mais Falante 1, por exemplo. Nenhuma outra ferramenta exporta uma mixagem personalizada em um passo.
Remova a música de fundo ou o ruído do seu vídeo de duas formas
A risada de um podcast, a reação da plateia, uma tosse durante a palestra — a maioria dos removedores de vocais não distingue isso da fala. O Perso Dubbing oferece as duas opções com um único upload.
Música de fundo
Remove todo som humano — fala, risadas, palmas — deixando apenas o som de fundo. Ideal para BGM livre de direitos e bases limpas para redublagem.
Fundo com reações
Remove apenas a fala, mantendo risadas, aplausos e a energia da plateia. Perfeito para podcasts, eventos ao vivo e programas em que a atmosfera importa.
Uma faixa por voz — separação por falante para entrevistas, podcasts e reuniões
A maioria dos removedores de vocais para em dois stems: voz e música. A separação multifalante do Perso Dubbing vai além — a IA detecta quantas pessoas estão falando e divide a gravação em faixas individuais por falante, cada uma com uma transcrição identificada em 99+ idiomas.
Uma gravação misturada
Uma gravação de entrevista, podcast ou reunião com várias pessoas falando sobre música e ruído ambiente — enviada como um único arquivo de áudio ou vídeo.
Uma faixa separada para cada falante
Separe os falantes do áudio com um clique: exporte a faixa de um único falante ou qualquer combinação que quiser — sem edição manual.
Quem usa separação de áudio?
🛡 Resolução de copyright
Remova a BGM protegida mantendo o diálogo intacto, troque por música livre de royalties e reenvie sem reivindicações.
🎙 Edição de podcast
Corte vícios de linguagem e falas indesejadas mantendo as risadas da plateia e as reações ambientes intactas.
🌍 Dublagem de vídeo
Extraia uma BGM limpa, sem vazamento de voz, e aplique uma nova locução em qualquer um de mais de 99 idiomas.
💼 Reuniões e conferências
Separe os falantes do áudio em gravações do Zoom ou Meet — cada participante ganha sua própria faixa, com transcrições identificadas por falante incluídas.
📱 Clipes para redes sociais
Troque a BGM original dos seus vídeos curtos por uma faixa em alta — sem mexer na sua narração.
🎤 Shows e fancams
Remova o ruído da plateia e a reverberação do local em clipes ao vivo para isolar a voz do artista ou a música.
📰 Jornalismo e entrevistas
Use a separação multifalante para extrair a voz de cada entrevistado de gravações de campo ruidosas, com transcrições limpas para checagem.
♻️ Reaproveite conteúdo
Um único upload vira áudio de podcast, BGM promocional, clipes de falantes para redes sociais e uma transcrição completa para o blog.
Faça mais no espaço de trabalho da Perso
Perguntas frequentes
O Perso Dubbing Audio Separation é gratuito?
Preciso criar uma conta para testar a separação de áudio?
O que acontece se meu arquivo tiver mais de 60 segundos?
Meus arquivos ficam armazenados nos servidores da Perso Dubbing?
Quais formatos e tamanhos de arquivo são aceitos?
Qual a diferença entre Música de fundo e Fundo com reações?
O Perso Dubbing faz separação multifalante, não só voz e música?
Qual a precisão da separação do Perso Dubbing em relação a outras ferramentas?
Posso remover música protegida por direitos autorais do meu vídeo?
Como faço para tirar a música de fundo de um vídeo que eu gravei?
Qual a diferença do Perso Dubbing para o LALAL.AI ou o Moises?
Posso combinar faixas selecionadas em um único arquivo?
Explore os recursos do nosso produto
Teste com o seu próprio arquivo — agora mesmo
Os primeiros 60 segundos são grátis. Sem cadastro, sem arquivos armazenados, sem pegadinha.
↑ Enviar um arquivo
EN
KO
ES
PT
RU
ID
DE
TH
JP
TC