Separa voces, hablantes y música
Gratis, en línea, en segundos
¿Sonaba música durante la grabación? ¿Ruido de fondo no deseado? Suelta cualquier archivo de audio o vídeo aquí abajo y Perso Dubbing lo separa en voces, hablantes individuales y música de fondo, para que escuches cada pista antes de registrarte.
Sin registro · Primeros 60 segundos gratis · Los archivos nunca se almacenan
Haz clic o arrastra y suelta tu archivo
La separación empieza al instante — sin cuenta (hasta 200MB)
¿No tienes un archivo a mano? Prueba una muestra:
Separando pistas de audio...
Analizando las frecuencias de sonido para separar la voz de los elementos de fondo
En el espacio de trabajo puedes editar el guion de cada hablante línea por línea
Alcanzaste el límite gratuito de hoy
Has usado las 3 separaciones gratis de hoy. Regístrate gratis para continuar.
El plan Starter elimina el límite diario.
Rendimiento de primer nivel — medido, no prometido
Tres benchmarks públicos estándar de la industria: MUSDB18 para separación vocal, VoiceBank-DEMAND para reducción de ruido y el Open ASR Leaderboard para transcripción. Los mismos datasets que usa cada paper, frente a motores con nombre y apellido, con datos por muestra publicados para que cualquiera repita las pruebas.
Separación vocal más alto = mejor
Ganamos en 44 de 50 pistas — y cuando perdemos, la diferencia es de 0.66 dB como máximo.
Calidad de eliminación de ruido más alto = mejor
El especialista DeepFilterNet3 lidera por muy poco (2.77 frente a 2.64) — ambos muy por delante de ElevenLabs.
Claridad del habla más alto = mejor
Los dos primeros están prácticamente empatados. ElevenLabs hace el habla más difícil de entender en la mitad de las muestras — nosotros la mejoramos en el 96%.
Fidelidad de clonación de voz más alto = mejor
Primeros en los dos sistemas de clonación probados — incluso dentro del propio clonador de ElevenLabs. La barra rayada es el original limpio: el techo natural.
Precisión de transcripción (WER) más bajo = mejor
En conjunto, empate estadístico con Scribe v2 — pero en contenido con varios hablantes, como pódcasts, salimos ganando (barra más corta = menos errores).
Las barras están ampliadas al rango competitivo para que las diferencias pequeñas sigan siendo visibles — lo que cuenta es la cifra exacta junto a cada barra.
¿Qué miden realmente estas pruebas?
🎯 Separación vocal (SI-SDR) Más alto = mejor
Qué tan limpio se separan voz y música — como extraer una pista de karaoke sin rastro de voz. Nuestra puntuación: 10.67 dB frente a 8.36 dB de HTDemucs — menos filtraciones entre pistas, y ganamos en 44 de 50 canciones.
🔊 Eliminación de ruido (PESQ · ESTOI) Más alto = mejor
Qué tan clara y natural suena la voz tras eliminar el ruido — la misma métrica usada para la calidad de llamadas. Obtenemos 2.64, apenas por detrás del especialista DeepFilterNet3 (2.77) y muy por delante de ElevenLabs (2.38). En claridad, empatamos en el primer puesto.
📝 Precisión de transcripción (WER) Más bajo = mejor
De cada 100 palabras habladas, cuántas se transcriben mal. Nuestro 7.61% significa unas 92 de cada 100 palabras correctas — estadísticamente igual que ElevenLabs Scribe v2 (7.52%), y por delante en grabaciones con varios hablantes como los pódcasts.
🎤 Fidelidad de clonación de voz (cos_sim) Más alto = mejor
Tras la limpieza, ¿un clon de voz creado con ese audio sigue sonando como la misma persona? Puntuado de 0 a 1 frente a la voz original. Nuestro 0.674 es el primero en los dos sistemas de clonación probados — incluso dentro del propio clonador de ElevenLabs.
Notas honestas: la separación vocal se mide sobre el conjunto de muestras de MUSDB18 (repetición completa con MUSDB18-HQ en curso, esperada dentro de ±0.5 dB). DeepFilterNet3 nos supera en PESQ por 0.15 — empatamos en claridad y lideramos en fidelidad de forma de onda (+18.66 frente a +17.31 dB SI-SDR). MDX-Net y LALAL.AI aún no se han probado, así que no afirmamos superar a todos los separadores. Verificado en mayo de 2026.
Tres pasos, en menos de un minuto
Sube tu archivo
Arrastra y suelta un archivo de audio o vídeo — MP3, WAV, M4A, MP4, MOV o WebM, hasta 200MB. Sin cuenta para los primeros 60 segundos.
Escucha las pistas separadas
La IA divide tu archivo en hablantes individuales, música de fondo pura y fondo con reacciones. Reproduce cada pista directamente en el navegador.
Exporta tu mezcla
Elige las pistas que necesites y expórtalas en un solo archivo. Inicia sesión para descargar o procesar archivos más largos completos.
Mucho más que un eliminador de voces
😂 Dos modos de audio de fondo
BGM pura, o BGM con risas y aplausos intactos. Ninguna otra herramienta de separación ofrece ambos con una sola subida.
👤 Separación de varios hablantes
No solo voz frente a música — la separación por hablante da a cada persona de la grabación su propia pista, además de una transcripción etiquetada en 99+ idiomas.
🔒 No guardamos nada
Los archivos de prueba se procesan en almacenamiento temporal y se eliminan al terminar la sesión. Nunca se conservan ni se usan para entrenamiento.
📝 Transcripción en 99+ idiomas
Cada separación incluye conversión automática de voz a texto con etiquetas de hablante, junto a tus pistas. La detección de idioma es automática — sin herramientas ni pasos extra.
🎬 Funciona con audio y vídeo
Sube MP3, WAV, M4A, MP4, MOV o WebM. Exporta pistas con subtítulos incrustados o archivos SRT aparte.
🎚 Exportación de mezcla selectiva
Combina las pistas que quieras en un solo archivo — por ejemplo, música de fondo más Hablante 1. Ninguna otra herramienta exporta una mezcla personalizada en un solo paso.
Elimina la música de fondo o el ruido de tu vídeo de dos formas
Las risas de un pódcast, la reacción del público, una tos durante una ponencia — la mayoría de eliminadores de voz no las distinguen del habla. Perso Dubbing te da ambas opciones con una sola subida.
Música de fondo
Elimina todo sonido humano — habla, risas, aplausos — dejando solo el sonido de fondo. Ideal para BGM libre de derechos y bases limpias para redoblaje.
Fondo con reacciones
Elimina solo el habla, conservando risas, aplausos y la energía del público. Perfecto para pódcasts, eventos en directo y programas donde la atmósfera importa.
Una pista por voz — separación por hablante para entrevistas, pódcasts y reuniones
La mayoría de los eliminadores de voz se quedan en dos stems: voz y música. La separación de varios hablantes de Perso Dubbing va más allá — la IA detecta cuántas personas hablan y divide la grabación en pistas individuales por hablante, cada una con una transcripción etiquetada en 99+ idiomas.
Una grabación mezclada
Una grabación de entrevista, pódcast o reunión con varias personas hablando sobre música y ruido ambiente — subida como un solo archivo de audio o vídeo.
Una pista separada para cada hablante
Separa a los hablantes del audio con un clic: exporta la pista de un solo hablante o la combinación que quieras — sin edición manual.
¿Quién usa la separación de audio?
🛡 Resolución de copyright
Elimina la BGM con derechos manteniendo el diálogo intacto, cámbiala por música libre de regalías y vuelve a subir sin reclamaciones.
🎙 Edición de pódcasts
Corta muletillas y voces no deseadas conservando las risas del público y las reacciones ambientales.
🌍 Doblaje de vídeo
Extrae una pista de BGM limpia sin restos de voz y superpón una nueva locución en cualquiera de más de 99 idiomas.
💼 Reuniones y conferencias
Separa a los hablantes del audio en grabaciones de Zoom o Meet — cada participante obtiene su propia pista, con transcripciones etiquetadas por hablante incluidas.
📱 Clips para redes sociales
Cambia la BGM original de tus vídeos cortos por un tema en tendencia — sin tocar tu voz en off.
🎤 Conciertos y fancams
Elimina el ruido del público y la reverberación del recinto en clips en directo para aislar la voz del artista o la música.
📰 Periodismo y entrevistas
Usa la separación de varios hablantes para extraer la voz de cada entrevistado de grabaciones de campo ruidosas, con transcripciones limpias para verificación.
♻️ Reutiliza tu contenido
Una sola subida se convierte en audio de pódcast, BGM promocional, clips de hablantes para redes y una transcripción completa para tu blog.
Haz más en el espacio de trabajo de Perso
Preguntas frecuentes
¿Perso Dubbing Audio Separation es gratis?
¿Necesito crear una cuenta para probar la separación de audio?
¿Qué pasa si mi archivo dura más de 60 segundos?
¿Mis archivos se guardan en los servidores de Perso Dubbing?
¿Qué formatos y tamaños de archivo se admiten?
¿Cuál es la diferencia entre Música de fondo y Fondo con reacciones?
¿Perso Dubbing hace separación de varios hablantes, no solo voz y música?
¿Qué precisión tiene la separación de Perso Dubbing frente a otras herramientas?
¿Puedo eliminar música con copyright de mi vídeo?
¿Cómo quito la música de fondo de un vídeo que grabé yo?
¿En qué se diferencia Perso Dubbing de LALAL.AI o Moises?
¿Puedo combinar pistas seleccionadas en un solo archivo?
Explora las funciones de nuestro producto
Pruébalo con tu propio archivo — ahora mismo
Los primeros 60 segundos son gratis. Sin registro, sin archivos guardados, sin letra pequeña.
↑ Subir un archivo
EN
KO
ES
PT
RU
ID
DE
TH
JP
TC