🏆 Разделение мирового уровня

Разделяйте вокал, голоса и музыку
Бесплатно, онлайн, за секунды

Во время съёмки играла музыка? На фоне лишний шум? Перетащите сюда любой аудио- или видеофайл — Perso Dubbing разделит его на вокал, отдельные голоса и фоновую музыку, а вы прослушаете каждую дорожку ещё до регистрации.

Без регистрации · Первые 60 секунд бесплатно · Файлы не сохраняются

Разделение аудио

Нажмите или перетащите файл

Разделение начинается мгновенно — без аккаунта (до 200 МБ)

mp4movwebm wavmp3m4a

Нет файла под рукой? Попробуйте образец:

Разделяем аудиодорожки...

Анализируем звуковые частоты, чтобы отделить голос от фоновых элементов

В рабочем пространстве можно построчно редактировать реплики спикеров

Ваш файл длиннее 60 секунд — мы разделили первую минуту, чтобы вы могли оценить качество. Войдите, чтобы обработать весь файл
Скачать все файлы
Фоновое аудио
Фон (.wav)
Фон с реакциями (.wav)new
Аудио говорящих
Все говорящие (вокал) (.wav)
Говорящий 1 (.wav)
Говорящий 2 (.wav)
Бенчмарки

Мировой уровень — измеренный, а не заявленный

Три общепринятых публичных бенчмарка: MUSDB18 для разделения вокала, VoiceBank-DEMAND для шумоподавления и Open ASR Leaderboard для транскрипции. Те же датасеты, что и в научных работах, против конкретных движков — с опубликованными данными по каждому образцу, чтобы любой мог перепроверить.

Разделение вокала выше = лучше

MUSDB18 (vocals) · median SI-SDR
Perso Dubbing 🏆
10.67 dB
HTDemucs (Meta)
8.36 dB
LALAL.AI · MDX-Net
ещё не тестировалось

Победа на 44 из 50 треков — а там, где проигрываем, отставание не больше 0.66 дБ.

Качество шумоподавления выше = лучше

VoiceBank-DEMAND · PESQ-WB
DeepFilterNet3
2.77
Perso Dubbing
2.64
ElevenLabs
2.38
Зашумлённый вход (до очистки)
1.70

Специализированный DeepFilterNet3 впереди на волосок (2.77 против 2.64) — оба с большим отрывом от ElevenLabs.

Разборчивость речи выше = лучше

VoiceBank-DEMAND · ESTOI
DeepFilterNet3
0.821
Perso Dubbing
0.817
ElevenLabs
0.769
Зашумлённый вход (до очистки)
0.747

Первые два результата практически равны. ElevenLabs ухудшает разборчивость речи на половине образцов — мы улучшаем её на 96%.

Точность клонирования голоса выше = лучше

30 говорящих · 2 системы клонирования · cos_sim
Чистый оригинал (потолок)
0.736
Perso Dubbing 🏆
0.674
ElevenLabs Audio Iso.
0.665
DeepFilterNet3
0.652

Первое место в обеих протестированных системах клонирования — даже внутри собственного клонера ElevenLabs. Полосатая полоса — чистый оригинал: естественный потолок.

Точность транскрипции (WER) ниже = лучше

Open ASR Leaderboard · 8 configs · word error rate
Среднее по 8 бенчмаркам статистическая ничья
Scribe v2 (ElevenLabs)
7.52%
Perso Dubbing
7.61%
Записи с несколькими говорящими (GigaSpeech)
Perso Dubbing 🏆
10.70%
Scribe v2 (ElevenLabs)
11.48%
Whisper large-v3
ещё не тестировалось

В целом — статистическая ничья со Scribe v2, но на записях с несколькими говорящими, например подкастах, мы впереди (короче полоса = меньше ошибок).

Полосы масштабированы под конкурентный диапазон, чтобы небольшие различия оставались заметными — решает точное число рядом с каждой полосой.

Что на самом деле измеряют эти тесты?

🎯 Разделение вокала (SI-SDR) Выше = лучше

Насколько чисто голос отделяется от музыки — как получить караоке-дорожку без единого следа голоса. Наш результат: 10.67 дБ против 8.36 дБ у HTDemucs — меньше «протечек» между дорожками, победа на 44 из 50 треков.

🔊 Удаление шума (PESQ · ESTOI) Выше = лучше

Насколько чисто и естественно звучит речь после удаления шума — та же метрика, что используется для оценки качества телефонной связи. Наш результат — 2.64: чуть позади специализированного DeepFilterNet3 (2.77) и с большим отрывом впереди ElevenLabs (2.38). По разборчивости — делим первое место.

📝 Точность транскрипции (WER) Ниже = лучше

Сколько из 100 произнесённых слов записывается неверно. Наши 7.61% — это примерно 92 правильных слова из 100 — статистически наравне с ElevenLabs Scribe v2 (7.52%) и впереди на записях с несколькими говорящими, например в подкастах.

🎤 Точность клонирования голоса (cos_sim) Выше = лучше

Звучит ли голосовой клон, созданный из очищенного аудио, как тот же человек? Оценка от 0 до 1 относительно оригинального голоса. Наши 0.674 — первое место в обеих протестированных системах клонирования, включая собственный клонер ElevenLabs.

Честные примечания: разделение вокала измерено на сэмпл-наборе MUSDB18 (полный перезапуск на MUSDB18-HQ в процессе, ожидаемое отклонение ±0.5 дБ). DeepFilterNet3 опережает нас по PESQ на 0.15 — по разборчивости ничья, по точности волновой формы мы впереди (+18.66 против +17.31 дБ SI-SDR). MDX-Net и LALAL.AI ещё не тестировались, поэтому мы не утверждаем, что превосходим все сепараторы. Проверено в мае 2026 года.

Суть: на публичных бенчмарках наш движок разделял вокал чище, чем HTDemucs от Meta, на 44 из 50 песен, сравнялся со специализированным шумоподавителем DeepFilterNet3 и обошёл ElevenLabs Audio Isolation на 92–100% образцов. Он даже создаёт более качественные голосовые клоны внутри собственной системы клонирования ElevenLabs, чем её собственный препроцессор. Проверено в мае 2026 года — данные по каждому образцу опубликованы.
Как это работает

Три шага — меньше минуты

STEP 1

Загрузите файл

Перетащите аудио- или видеофайл — MP3, WAV, M4A, MP4, MOV или WebM, до 200 МБ. Первые 60 секунд — без аккаунта.

STEP 2

Прослушайте разделённые дорожки

ИИ разложит файл на отдельных говорящих, чистую фоновую музыку и фон с реакциями. Слушайте каждую дорожку прямо в браузере.

STEP 3

Экспортируйте свой микс

Выберите нужные дорожки и экспортируйте их одним файлом. Войдите, чтобы скачать результат или обработать длинные файлы целиком.

Почему Perso Dubbing

Больше, чем удаление вокала

😂 Два режима фонового звука

Чистая фоновая музыка — или музыка с сохранёнными смехом и аплодисментами. Ни один другой сепаратор не даёт оба варианта с одной загрузки.

👤 Разделение по говорящим

Не просто «голос против музыки» — разделение по говорящим даёт каждому человеку в записи собственную дорожку, плюс транскрипцию с метками говорящих на 99+ языках.

🔒 Ничего не хранится

Пробные файлы обрабатываются во временном хранилище и удаляются по окончании сессии. Не сохраняются и не используются для обучения.

📝 Транскрипция на 99+ языках

Каждое разделение включает автоматическое распознавание речи с метками говорящих — прямо рядом с дорожками. Язык определяется автоматически, без лишних инструментов и шагов.

🎬 Работает с аудио и видео

Загружайте MP3, WAV, M4A, MP4, MOV или WebM. Экспортируйте дорожки со встроенными субтитрами или отдельными SRT-файлами.

🎚 Выборочный экспорт микса

Объединяйте любые дорожки в один файл — например, фоновую музыку и Говорящего 1. Ни один другой инструмент не экспортирует кастомный микс в один шаг.

Режим двойного фонового звука

Два способа убрать фоновую музыку или шум из видео

Смех в подкасте, реакция зала, кашель на презентации — большинство «вокал-риммуверов» не отличают их от речи. Perso Dubbing даёт оба варианта с одной загрузки.

MODE 1

Фоновая музыка

Убирает все звуки человека — речь, смех, хлопки — оставляя только фоновый звук. Идеально для BGM без авторских прав и чистой подложки под переозвучку.

🗣 РечьУДАЛЕНО
😂 Смех / АплодисментыУДАЛЕНО
🎵 Фоновая музыкаСОХРАНЕНО
MODE 2 · Only in Perso Dubbing

Фон с реакциями

Убирает только речь, сохраняя смех, аплодисменты и энергию зала. Идеально для подкастов, живых событий и шоу, где важна атмосфера.

🗣 РечьУДАЛЕНО
😂 Смех / АплодисментыСОХРАНЕНО
🎵 Фоновая музыкаСОХРАНЕНО
Разделение нескольких говорящих

Отдельная дорожка на каждый голос — разделение по говорящим для интервью, подкастов и встреч

Большинство «вокал-риммуверов» останавливаются на двух дорожках: голос и музыка. Разделение нескольких говорящих в Perso Dubbing идёт дальше — ИИ определяет, сколько человек говорит, и разбивает запись на отдельные дорожки по говорящим, каждая с транскрипцией и метками на 99+ языках.

INPUT

Одна смешанная запись

Запись интервью, подкаста или встречи, где несколько человек говорят на фоне музыки и шума, — загружается одним аудио- или видеофайлом.

🎙 Спикер 1 + Спикер 2 + МузыкаСМЕШАНО
OUTPUT · Speaker separation

Отдельная дорожка для каждого говорящего

Разделяйте говорящих в аудио одним кликом: экспортируйте дорожку одного говорящего или любую нужную комбинацию — без ручного редактирования.

🎤 Спикер 1СВОЯ ДОРОЖКА
🎤 Спикер 2СВОЯ ДОРОЖКА
🎵 Фоновая музыкаСВОЯ ДОРОЖКА
Сценарии использования

Кому нужно разделение аудио?

🛡 Снятие претензий по авторским правам

Удалите защищённую авторским правом музыку, сохранив диалоги, подставьте роялти-фри трек и перезалейте видео без страйков.

🎙 Монтаж подкастов

Вырезайте слова-паразиты и лишнюю речь, не трогая смех аудитории и живые реакции.

🌍 Дубляж видео

Получите чистую фоновую дорожку без остатков речи и наложите новую озвучку на любом из 99+ языков.

💼 Встречи и конференции

Разделяйте говорящих в аудио записей Zoom и Meet — каждый участник получает собственную дорожку, а транскрипция с метками говорящих уже встроена.

📱 Ролики для соцсетей

Замените исходную музыку в коротких видео на трендовый трек — не трогая закадровый голос.

🎤 Концерты и фанкамы

Уберите шум толпы и реверберацию зала из живых записей, чтобы выделить голос артиста или музыку.

📰 Журналистика и интервью

Используйте разделение нескольких говорящих, чтобы выделить голос каждого собеседника из шумных полевых записей — с чистой транскрипцией для фактчекинга.

♻️ Переиспользование контента

Одна загрузка превращается в аудио для подкаста, промо-BGM, клипы говорящих для соцсетей и полную транскрипцию для блога.

Больше возможностей в рабочем пространстве Perso

FAQ

Частые вопросы

Perso Dubbing Audio Separation — это бесплатно?
Да. Загрузите любой аудио- или видеофайл и разделите первые 60 секунд совершенно бесплатно — без регистрации и банковской карты. Чтобы скачать результат или обработать файл длиннее 60 секунд, оформите подписку на Perso Dubbing. Платные планы расширяют лимиты и добавляют редактирование говорящих.
Нужен ли аккаунт, чтобы попробовать разделение аудио?
Нет. 60-секундная проба полностью работает без аккаунта. Загрузите файл, прослушайте каждую дорожку в браузере и решите, устраивает ли качество. Аккаунт нужен только для скачивания результата или обработки длинных файлов.
Что будет, если файл длиннее 60 секунд?
Такие файлы тоже принимаются — ИИ обработает первые 60 секунд, чтобы вы оценили качество на собственном материале. Чтобы разделить файл целиком, войдите и загрузите файл заново.
Хранятся ли мои файлы на серверах Perso Dubbing?
Нет. Пробные загрузки обрабатываются во временном хранилище и автоматически удаляются по окончании сессии. Perso Dubbing не хранит, не переиспользует и не обучается на файлах из бесплатной пробы.
Какие форматы и размеры файлов поддерживаются?
Perso Dubbing принимает аудио MP3, WAV и M4A, а также видео MP4, MOV и WebM — до 200 МБ за загрузку. Видео обрабатывается автоматически: ИИ извлекает аудио и разделяет его.
Чем «Фоновая музыка» отличается от «Фона с реакциями»?
«Фоновая музыка» убирает все звуки человека — речь, смех, аплодисменты — и оставляет только чистый фоновый звук. «Фон с реакциями» убирает только речь, сохраняя смех, аплодисменты и звуки зала — живую атмосферу подкастов и мероприятий. Perso Dubbing создаёт обе дорожки с одной загрузки.
Умеет ли Perso Dubbing разделять нескольких говорящих, а не только голос и музыку?
Да. Помимо разделения «голос/музыка», Perso Dubbing выполняет полное разделение по говорящим (его также называют speaker split): ИИ распознаёт каждого говорящего в записи и создаёт отдельную дорожку на каждого, плюс транскрипцию с метками говорящих на 99+ языках. Поэтому он подходит для интервью, подкастов и записей встреч, а не только для музыки.
Насколько точен Perso Dubbing по сравнению с другими инструментами?
На стандартном бенчмарке MUSDB18 Perso Dubbing разделяет вокал чище, чем HTDemucs от Meta, на 44 из 50 треков (10.67 против 8.36 дБ медианного SI-SDR). В шумоподавлении на VoiceBank-DEMAND он наравне со специализированным DeepFilterNet3 и превосходит ElevenLabs Audio Isolation на 92-100% образцов. Данные по каждому образцу опубликованы — цифры можно перепроверить.
Могу ли я убрать защищённую авторским правом музыку из видео?
Да. Загрузите видео, дайте ИИ разделить аудиодорожки и экспортируйте только голос и говорящих — без фоновой музыки. Это самый быстрый способ снять претензии по авторским правам на YouTube, TikTok или Instagram без пересъёмки.
Как убрать фоновую музыку из видео, которое я снял сам?
Загрузите видеофайл напрямую — извлекать звук заранее не нужно. Perso Dubbing разделяет речь, фоновую музыку и окружающие звуки на отдельные дорожки: экспортируйте микс только с речью, чтобы убрать музыку, или соберите любое сочетание дорожек. Поддерживаются MP4, MOV и WebM, а первые 60 секунд бесплатны.
Чем Perso Dubbing отличается от LALAL.AI или Moises?
Музыкальные инструменты разделяют вокал и инструменты — и на этом всё. Perso Dubbing объединяет разделение с транскрипцией на 99+ языках, переназначением говорящих, двумя режимами фонового звука и выборочным миксом дорожек в одном процессе — для видеокреаторов и редакторов контента, а не только музыкантов.
Можно ли объединить выбранные дорожки в один файл?
Да. Выберите любую комбинацию разделённых дорожек — например, фоновую музыку и Говорящего 1 — и экспортируйте их одним аудиофайлом. Такой выборочный экспорт микса есть только у Perso Dubbing.

Попробуйте на собственном файле — прямо сейчас

Первые 60 секунд бесплатно. Без регистрации, без хранения файлов, без подвоха.

↑ Загрузить файл