🏆 세계 최고 수준의 분리 성능

보컬, 화자, 음악을 분리하세요
무료로, 온라인에서, 단 몇 초 만에

촬영할 때 음악이 깔렸나요? 배경에 원치 않는 소음이 섞였나요? 아래에 오디오나 영상 파일을 올려보세요. Perso Dubbing이 보컬, 개별 화자, 배경음악으로 분리해 주고, 가입 전에 모든 트랙을 미리 들어볼 수 있어요.

가입 필요 없음 · 첫 60초 무료 · 파일은 저장되지 않음

음성 분리

클릭하거나 파일을 끌어다 놓으세요

분리가 즉시 시작돼요 — 계정 불필요 (최대 200MB)

mp4movwebm wavmp3m4a

파일이 없으신가요? 샘플로 체험해 보세요:

오디오 트랙을 분리하는 중...

음성과 주변 배경 소리를 분리하기 위해 음향 주파수를 분석하고 있어요

워크스페이스에서는 문장 단위로 화자 스크립트를 편집할 수 있어요

파일이 60초보다 길어서 품질을 확인하실 수 있도록 첫 1분만 분리했어요. 전체 파일을 처리하려면 로그인하세요
전체 파일 다운로드
배경 오디오
배경음 (.wav)
리액션 포함 배경음 (.wav)new
화자 오디오
전체 화자 (보컬) (.wav)
화자 1 (.wav)
화자 2 (.wav)
벤치마크

세계 최고 성능 — 주장이 아니라 측정으로 증명합니다

업계 표준 공개 벤치마크 3종으로 측정합니다 — 보컬 분리는 MUSDB18, 음성 노이즈 제거는 VoiceBank-DEMAND, 전사는 Open ASR Leaderboard. 모든 연구 논문이 쓰는 동일한 데이터셋에서, 이름을 명시한 엔진들과 비교하고, 샘플별 데이터를 공개해 누구나 재검증할 수 있게 합니다.

보컬 분리 높을수록 좋음

MUSDB18 (vocals) · median SI-SDR
Perso Dubbing 🏆
10.67 dB
HTDemucs (Meta)
8.36 dB
LALAL.AI · MDX-Net
측정 예정

50곡 중 44곡 승리 — 졌을 때도 격차는 최대 0.66 dB입니다.

노이즈 제거 품질 높을수록 좋음

VoiceBank-DEMAND · PESQ-WB
DeepFilterNet3
2.77
Perso Dubbing
2.64
ElevenLabs
2.38
원본 (정리 전)
1.70

전문 모델 DeepFilterNet3가 근소하게 앞서고(2.77 vs 2.64), 둘 다 ElevenLabs보다 크게 앞섭니다.

음성 명료도 높을수록 좋음

VoiceBank-DEMAND · ESTOI
DeepFilterNet3
0.821
Perso Dubbing
0.817
ElevenLabs
0.769
원본 (정리 전)
0.747

상위 둘은 사실상 동률입니다. ElevenLabs는 샘플 절반에서 명료도를 오히려 떨어뜨리고, 저희는 96%에서 개선합니다.

보이스 클론 충실도 높을수록 좋음

화자 30명 · 클로닝 시스템 2종 · cos_sim
원본 클린 음성 (상한선)
0.736
Perso Dubbing 🏆
0.674
ElevenLabs Audio Iso.
0.665
DeepFilterNet3
0.652

테스트한 두 클로닝 시스템 모두 1위 — ElevenLabs 자체 클로너 안에서도요. 빗금 막대는 원본 클린 음성, 즉 자연 상한선입니다.

전사 정확도 (WER) 낮을수록 좋음

Open ASR Leaderboard · 8 configs · word error rate
8개 벤치마크 평균 통계적 동률
Scribe v2 (ElevenLabs)
7.52%
Perso Dubbing
7.61%
다중 화자 콘텐츠 (GigaSpeech)
Perso Dubbing 🏆
10.70%
Scribe v2 (ElevenLabs)
11.48%
Whisper large-v3
측정 예정

전체 평균은 Scribe v2와 통계적 동률 — 하지만 팟캐스트처럼 화자가 여러 명인 콘텐츠에서는 저희가 앞섭니다 (막대가 짧을수록 오류가 적음).

막대는 작은 차이가 보이도록 경쟁 구간을 확대해 표시했습니다 — 판단 기준은 각 막대 옆의 정확한 점수입니다.

이 표의 지표, 쉽게 말하면 이렇습니다

🎯 보컬 분리 (SI-SDR) 높을수록 좋음

목소리와 음악이 얼마나 깨끗하게 나뉘는지 — 목소리가 전혀 남지 않은 MR을 뽑아내는 능력입니다. 저희 점수는 10.67 dB, Meta의 HTDemucs는 8.36 dB — 소리가 서로 덜 새어 들어간다는 뜻이고, 50곡 중 44곡에서 저희가 이겼습니다.

🔊 노이즈 제거 (PESQ · ESTOI) 높을수록 좋음

소음을 걷어낸 뒤 음성이 얼마나 또렷하고 자연스럽게 들리는지 — 전화 통화 음질 평가와 같은 채점 방식입니다. 저희는 2.64로 전문 모델 DeepFilterNet3(2.77)에 근소하게 뒤지지만 ElevenLabs(2.38)보다는 크게 앞섭니다. 명료도에서는 공동 1위입니다.

📝 전사 정확도 (WER) 낮을수록 좋음

말한 단어 100개 중 몇 개를 잘못 받아쓰는지입니다. 저희 7.61%는 100단어 중 약 92개를 정확히 받아쓴다는 뜻으로, ElevenLabs Scribe v2(7.52%)와 통계적으로 동일하고, 팟캐스트처럼 화자가 여러 명인 녹음에서는 오히려 앞섭니다.

🎤 보이스 클론 충실도 (cos_sim) 높을수록 좋음

정리된 오디오로 만든 목소리 클론이 여전히 원래 그 사람처럼 들리는지를 원본 목소리 대비 0~1로 채점합니다. 저희 0.674는 테스트한 두 클로닝 시스템 모두에서 1위 — ElevenLabs 자체 클로닝 시스템 안에서도 마찬가지였습니다.

정직한 각주: 보컬 분리는 MUSDB18 샘플셋 기준이며 전체 MUSDB18-HQ 재측정이 진행 중입니다(±0.5 dB 내 예상). 노이즈 제거 PESQ에서는 DeepFilterNet3가 0.15 차이로 앞서고, 명료도는 동률, 파형 충실도(SI-SDR +18.66 vs +17.31 dB)는 저희가 앞섭니다. MDX-Net과 LALAL.AI는 아직 미측정이므로 모든 분리 툴을 이긴다고 주장하지 않습니다. 2026년 5월 검증.

한 줄 요약: 공개 벤치마크에서 저희 엔진은 50곡 중 44곡에서 Meta HTDemucs보다 보컬을 더 깨끗하게 분리했고, 전문 노이즈 제거 모델 DeepFilterNet3와 대등했으며, ElevenLabs Audio Isolation은 92~100% 샘플에서 앞섰습니다. 심지어 ElevenLabs 자체 클로닝 시스템 안에서도 ElevenLabs 전처리보다 더 좋은 보이스 클론을 만듭니다. 2026년 5월 검증 — 샘플별 데이터를 공개해 누구나 재확인할 수 있습니다.
사용 방법

세 단계, 1분이면 충분합니다

STEP 1

파일 업로드

MP3, WAV, M4A, MP4, MOV, WebM 파일을 끌어다 놓으세요 (최대 200MB). 첫 60초는 계정이 필요 없습니다.

STEP 2

분리된 트랙 미리듣기

AI가 파일을 화자별 음성, 순수 배경음악, 리액션 포함 배경으로 분리합니다. 브라우저에서 각 트랙을 바로 재생해보세요.

STEP 3

믹스 내보내기

필요한 트랙만 골라 하나의 파일로 내보내세요. 다운로드하거나 긴 파일 전체를 처리하려면 로그인하면 됩니다.

왜 Perso Dubbing인가

보컬 리무버, 그 이상

😂 듀얼 배경음 모드

순수 BGM, 또는 웃음·박수를 살린 BGM. 한 번의 업로드로 두 가지를 모두 제공하는 분리 툴은 Perso Dubbing뿐입니다.

👤 다중 화자 분리

보컬·음악 분리에서 끝나지 않습니다. 화자 분리로 녹음 속 모든 사람이 각자 트랙을 갖고, 99개+ 언어로 화자 라벨이 붙은 스크립트도 함께 제공됩니다.

🔒 파일을 저장하지 않습니다

체험 파일은 임시 저장소에서 처리되고 세션이 끝나면 삭제됩니다. 보관하지 않고, 학습에도 사용하지 않습니다.

📝 99개+ 언어 자동 전사

분리할 때마다 화자 라벨이 붙은 음성-텍스트 전사가 트랙 바로 옆에 함께 제공됩니다. 언어 감지도 자동 — 별도 도구도, 추가 단계도 없습니다.

🎬 오디오·영상 모두 지원

MP3, WAV, M4A, MP4, MOV, WebM을 업로드하세요. 자막 내장 트랙 또는 별도 SRT 파일로 내보낼 수 있습니다.

🎚 선택 믹스 내보내기

원하는 트랙만 골라 하나의 파일로 합칠 수 있습니다 — 예를 들어 배경음악 + 화자 1. 커스텀 믹스를 한 번에 내보내는 분리 툴은 Perso Dubbing뿐입니다.

듀얼 배경음 모드

영상 속 배경음악·소음을 제거하는 두 가지 방법

팟캐스트의 웃음 트랙, 관객 리액션, 발표 중 기침 소리 — 대부분의 보컬 리무버는 이런 소리를 말소리와 구분하지 못합니다. Perso Dubbing은 한 번의 업로드로 두 가지 옵션을 모두 제공합니다.

MODE 1

배경음악

말소리, 웃음, 박수 등 사람이 내는 모든 소리를 제거하고 배경음만 남깁니다. 저작권 없는 BGM 추출, 재더빙용 클린 오디오에 적합합니다.

🗣 말소리제거
😂 웃음 / 박수제거
🎵 배경음악유지
MODE 2 · Only in Perso Dubbing

리액션 포함 배경

말소리만 제거하고 웃음, 박수, 현장의 에너지는 그대로 살립니다. 분위기가 중요한 팟캐스트, 라이브 행사, 예능에 잘 맞습니다.

🗣 말소리제거
😂 웃음 / 박수유지
🎵 배경음악유지
다중 화자 분리

목소리마다 하나의 트랙 — 인터뷰·팟캐스트·회의를 위한 화자 분리

대부분의 보컬 리무버는 보컬과 음악, 두 갈래에서 멈춥니다. Perso Dubbing의 다중 화자 분리는 한 걸음 더 나아가, AI가 몇 명이 말하는지 감지해 녹음을 화자별 개별 트랙으로 나누고 각 트랙마다 99개+ 언어로 라벨이 붙은 스크립트를 제공합니다.

INPUT

하나의 믹스된 녹음

여러 사람이 음악과 주변 소음 속에서 이야기하는 인터뷰·팟캐스트·회의 녹음 — 하나의 오디오 또는 영상 파일로 업로드합니다.

🎙 화자 1 + 화자 2 + 음악혼합
OUTPUT · Speaker separation

화자마다 별도의 트랙

클릭 한 번으로 오디오에서 화자를 분리하세요. 한 화자의 트랙만, 또는 원하는 조합으로 내보낼 수 있습니다 — 수작업 편집은 필요 없습니다.

🎤 화자 1개별 트랙
🎤 화자 2개별 트랙
🎵 배경음악개별 트랙
활용 사례

누가 오디오 분리를 쓰나요?

🛡 저작권 클레임 해결

대사는 그대로 두고 저작권 BGM만 제거한 뒤, 로열티 프리 음악으로 교체해 클레임 없이 재업로드하세요.

🎙 팟캐스트 편집

관객 웃음과 현장 리액션은 건드리지 않고, 군더더기 말과 불필요한 발화만 잘라냅니다.

🌍 영상 더빙

말소리가 전혀 섞이지 않은 클린 BGM 트랙을 추출한 뒤, 99개+ 언어의 새 보이스오버를 얹으세요.

💼 회의·컨퍼런스

Zoom·Meet 녹화의 오디오에서 화자를 분리해, 참석자마다 별도 트랙을 만들고 화자 라벨이 붙은 회의록까지 한 번에 받으세요.

📱 소셜 미디어 클립

숏폼 영상의 원본 BGM을 트렌딩 음원으로 교체하세요 — 보이스오버는 그대로 둔 채로.

🎤 콘서트·팬캠

라이브 클립에서 함성과 공연장 울림을 걷어내고 아티스트의 목소리나 음악만 분리합니다.

📰 저널리즘·인터뷰

다중 화자 분리로 소음 많은 현장 녹음에서 인터뷰이별 음성을 추출하고, 팩트체크용 클린 스크립트를 확보하세요.

♻️ 콘텐츠 재활용

한 번의 업로드로 팟캐스트 오디오, 홍보용 BGM, 소셜용 화자 클립, 블로그용 전체 스크립트까지.

워크스페이스에서 더 많은 기능을 사용해보세요

FAQ

자주 묻는 질문

Perso Dubbing 오디오 분리는 무료인가요?
네. 어떤 오디오·영상 파일이든 업로드해서 첫 60초를 완전 무료로 분리할 수 있고, 가입도 카드 등록도 필요 없습니다. 결과 다운로드나 60초 초과 파일 처리는 Perso Dubbing 구독 후 가능합니다. 유료 플랜에서는 처리 한도가 늘어나고 화자 편집 기능이 추가됩니다.
체험하려면 계정을 만들어야 하나요?
아니요. 60초 체험은 계정 없이 전 과정이 동작합니다. 파일을 올리고, 분리된 모든 트랙을 브라우저에서 들어본 뒤, 품질이 기대에 맞는지 직접 판단하세요. 계정은 결과를 다운로드하거나 긴 파일을 처리할 때만 필요합니다.
60초가 넘는 파일은 어떻게 되나요?
60초가 넘는 파일도 그대로 업로드됩니다. AI가 앞 60초를 처리해서 내 콘텐츠 기준으로 분리 품질을 확인할 수 있게 해줍니다. 전체 파일을 분리하려면 로그인 후 파일을 다시 업로드해야 합니다.
업로드한 파일이 Perso Dubbing 서버에 저장되나요?
아니요. 체험 업로드는 임시 저장소에서 처리되고 세션이 끝나면 자동 삭제됩니다. Perso Dubbing은 무료 체험으로 업로드된 파일을 보관하거나 재사용하거나 학습에 사용하지 않습니다.
지원하는 파일 형식과 용량은?
MP3, WAV, M4A 오디오와 MP4, MOV, WebM 영상을 업로드당 최대 200MB까지 지원합니다. 영상 파일은 자동으로 처리됩니다. AI가 오디오를 추출해 분리합니다.
배경음악 모드와 리액션 포함 배경 모드의 차이는?
배경음악 모드는 말소리·웃음·박수 등 사람이 내는 모든 소리를 제거하고 순수한 배경음만 남깁니다. 리액션 포함 배경 모드는 말소리만 제거하고 웃음, 박수, 관중 소리를 그대로 살려서 팟캐스트나 행사 녹음의 현장감을 유지합니다. Perso Dubbing은 한 번의 업로드로 두 트랙을 모두 생성합니다.
Perso Dubbing은 보컬·음악뿐 아니라 다중 화자 분리도 되나요?
네. 보컬/음악 분리를 넘어, Perso Dubbing은 완전한 화자 분리(스피커 분할이라고도 함)를 수행합니다. AI가 녹음 속 화자를 각각 감지해 화자별 트랙을 따로 만들고, 99개+ 언어로 화자 라벨이 붙은 스크립트도 함께 제공합니다. 그래서 음악뿐 아니라 인터뷰, 팟캐스트, 회의 녹음에도 잘 맞습니다.
다른 툴과 비교해 분리 정확도는 어느 정도인가요?
표준 벤치마크 MUSDB18에서 Perso Dubbing은 50곡 중 44곡에서 Meta HTDemucs보다 보컬을 더 깨끗하게 분리했습니다(SI-SDR 중앙값 10.67 vs 8.36 dB). VoiceBank-DEMAND 노이즈 제거에서는 전문 모델 DeepFilterNet3와 대등했고, ElevenLabs Audio Isolation은 92~100% 샘플에서 앞섰습니다. 샘플별 결과를 공개해 누구나 수치를 검증할 수 있습니다.
영상에서 저작권 배경음악을 제거할 수 있나요?
네. 영상을 업로드하면 AI가 오디오 트랙을 분리하고, 배경음악을 뺀 보컬·화자 트랙만 내보낼 수 있습니다. 콘텐츠를 다시 녹음하지 않고 YouTube, TikTok, Instagram의 저작권 클레임을 해결하는 가장 빠른 방법입니다.
직접 촬영한 영상에서 배경음악을 제거하려면 어떻게 하나요?
영상 파일을 그대로 올리면 됩니다. 오디오를 따로 추출할 필요가 없어요. Perso Dubbing이 음성, 배경음악, 주변음을 각각의 트랙으로 분리하니, 음성만 담긴 믹스를 내보내 음악을 빼거나 원하는 대로 조합해 내보낼 수 있습니다. MP4, MOV, WebM을 지원하며 첫 60초는 무료입니다.
LALAL.AI나 Moises와는 뭐가 다른가요?
음악 툴은 보컬과 악기를 나누는 데서 끝납니다. Perso Dubbing은 분리에 99개+ 언어 전사, 화자 재할당, 듀얼 배경음 모드, 선택 트랙 믹싱까지 하나의 워크플로우로 제공합니다 — 음악가만이 아니라 영상 크리에이터와 콘텐츠 편집자를 위해 설계됐습니다.
분리된 트랙을 골라서 하나의 파일로 합칠 수 있나요?
네. 분리된 트랙 중 원하는 조합 — 예를 들어 배경음악 + 화자 1 — 을 선택해 하나의 오디오 파일로 내보낼 수 있습니다. 이 선택 믹스 내보내기는 Perso Dubbing에만 있는 기능입니다.

지금 바로, 내 파일로 확인해보세요

첫 60초는 무료입니다. 가입도, 파일 저장도, 숨은 조건도 없습니다.

↑ 파일 업로드