🏆 Performa pemisahan kelas dunia

Pisahkan vokal, pembicara, dan musik
Gratis, online, dalam hitungan detik

Ada musik yang terputar saat perekaman? Derau yang tak diinginkan di latar? Letakkan file audio atau video apa pun di bawah ini, dan Perso Dubbing memisahkannya menjadi vokal, pembicara individual, dan musik latar, sehingga Anda bisa mendengar setiap trek sebelum mendaftar.

Tanpa pendaftaran · 60 detik pertama gratis · File tidak pernah disimpan

Pemisahan Audio

Klik atau seret & letakkan file Anda

Pemisahan langsung dimulai — tanpa akun (hingga 200MB)

mp4movwebm wavmp3m4a

Tidak ada file? Coba contoh:

Memisahkan trek audio...

Menganalisis frekuensi suara untuk memisahkan suara dari elemen latar belakang

Di workspace, Anda bisa mengedit skrip pembicara baris demi baris

File Anda lebih dari 60 detik — kami memisahkan menit pertama agar Anda bisa menilai kualitasnya. Masuk untuk memproses seluruh file
Unduh semua file
Audio Latar
Latar (.wav)
Latar dengan Reaksi (.wav)new
Audio Pembicara
Semua Pembicara (Vokal) (.wav)
Pembicara 1 (.wav)
Pembicara 2 (.wav)
Benchmark

Performa kelas dunia — diukur, bukan sekadar klaim

Tiga benchmark publik standar industri: MUSDB18 untuk pemisahan vokal, VoiceBank-DEMAND untuk penghilangan noise, dan Open ASR Leaderboard untuk transkripsi. Dataset yang sama dengan yang dipakai setiap paper riset, melawan engine ternama, dengan data per sampel yang dipublikasikan agar siapa pun bisa mengulang pengujiannya.

Pemisahan vokal tinggi = lebih baik

MUSDB18 (vocals) · median SI-SDR
Perso Dubbing 🏆
10.67 dB
HTDemucs (Meta)
8.36 dB
LALAL.AI · MDX-Net
belum diuji

Menang di 44 dari 50 trek — dan saat kalah, selisihnya paling besar 0.66 dB.

Kualitas penghilangan noise tinggi = lebih baik

VoiceBank-DEMAND · PESQ-WB
DeepFilterNet3
2.77
Perso Dubbing
2.64
ElevenLabs
2.38
Input ber-noise (sebelum dibersihkan)
1.70

Spesialis DeepFilterNet3 unggul tipis (2.77 vs 2.64) — keduanya jauh di depan ElevenLabs.

Kejernihan ucapan tinggi = lebih baik

VoiceBank-DEMAND · ESTOI
DeepFilterNet3
0.821
Perso Dubbing
0.817
ElevenLabs
0.769
Input ber-noise (sebelum dibersihkan)
0.747

Dua teratas praktis imbang. ElevenLabs membuat ucapan lebih sulit dipahami di separuh sampel — kami memperbaikinya di 96%.

Fidelitas kloning suara tinggi = lebih baik

30 pembicara · 2 sistem kloning · cos_sim
Asli bersih (batas atas)
0.736
Perso Dubbing 🏆
0.674
ElevenLabs Audio Iso.
0.665
DeepFilterNet3
0.652

Pertama di kedua sistem kloning yang diuji — bahkan di dalam kloner milik ElevenLabs sendiri. Bilah bergaris adalah audio asli yang bersih: batas atas alami.

Akurasi transkripsi (WER) rendah = lebih baik

Open ASR Leaderboard · 8 configs · word error rate
Rata-rata 8 benchmark imbang secara statistik
Scribe v2 (ElevenLabs)
7.52%
Perso Dubbing
7.61%
Konten multi-pembicara (GigaSpeech)
Perso Dubbing 🏆
10.70%
Scribe v2 (ElevenLabs)
11.48%
Whisper large-v3
belum diuji

Secara keseluruhan imbang secara statistik dengan Scribe v2 — tapi di konten multi-pembicara seperti podcast, kami unggul (bilah lebih pendek = lebih sedikit kesalahan).

Bilah diperbesar ke rentang kompetitif agar selisih kecil tetap terlihat — yang menentukan adalah angka pasti di samping tiap bilah.

Apa yang sebenarnya diukur tes ini?

🎯 Pemisahan vokal (SI-SDR) Makin tinggi = makin baik

Seberapa bersih suara dan musik dipisahkan — seperti mengekstrak trek karaoke tanpa sisa suara sama sekali. Skor kami: 10.67 dB vs 8.36 dB milik HTDemucs — kebocoran antar-trek lebih sedikit, dan kami menang di 44 dari 50 lagu.

🔊 Penghilangan noise (PESQ · ESTOI) Makin tinggi = makin baik

Seberapa jernih dan alami suara ucapan setelah noise dihilangkan — metrik yang sama dengan penilaian kualitas panggilan telepon. Skor kami 2.64, tipis di belakang spesialis DeepFilterNet3 (2.77) dan jauh di depan ElevenLabs (2.38). Untuk kejernihan, kami berbagi posisi pertama.

📝 Akurasi transkripsi (WER) Makin rendah = makin baik

Dari 100 kata yang diucapkan, berapa banyak yang salah ditulis. 7.61% kami berarti sekitar 92 dari 100 kata benar — secara statistik setara dengan ElevenLabs Scribe v2 (7.52%), dan unggul di rekaman multi-pembicara seperti podcast.

🎤 Fidelitas kloning suara (cos_sim) Makin tinggi = makin baik

Setelah dibersihkan, apakah klon suara dari audio itu masih terdengar seperti orang yang sama? Dinilai 0 sampai 1 terhadap suara asli. Skor 0.674 kami menempati posisi pertama di kedua sistem kloning yang diuji — bahkan di dalam kloner milik ElevenLabs sendiri.

Catatan jujur: pemisahan vokal diukur pada set sampel MUSDB18 (pengujian ulang penuh MUSDB18-HQ sedang berjalan, diperkirakan dalam ±0.5 dB). DeepFilterNet3 unggul 0.15 di PESQ — kami imbang di kejernihan dan unggul di fidelitas gelombang (+18.66 vs +17.31 dB SI-SDR). MDX-Net dan LALAL.AI belum diuji, jadi kami tidak mengklaim mengalahkan semua pemisah. Diverifikasi Mei 2026.

Intinya: di benchmark publik, engine kami memisahkan vokal lebih bersih daripada HTDemucs milik Meta di 44 dari 50 lagu, menyamai spesialis denoising DeepFilterNet3, dan mengalahkan ElevenLabs Audio Isolation di 92–100% sampel uji. Bahkan menghasilkan klon suara yang lebih baik di dalam sistem kloning ElevenLabs sendiri dibanding preprocessor milik mereka. Diverifikasi Mei 2026 — data per sampel dipublikasikan untuk diperiksa siapa pun.
Cara kerjanya

Tiga langkah, kurang dari satu menit

STEP 1

Unggah file Anda

Seret dan lepas file audio atau video — MP3, WAV, M4A, MP4, MOV, atau WebM, hingga 200MB. Tanpa akun untuk 60 detik pertama.

STEP 2

Dengarkan trek yang dipisahkan

AI membagi file Anda menjadi tiap pembicara, musik latar murni, dan latar dengan reaksi. Putar setiap trek langsung di browser.

STEP 3

Ekspor mix Anda

Pilih trek yang Anda butuhkan dan ekspor sebagai satu file. Masuk untuk mengunduh, atau memproses file panjang secara utuh.

Kenapa Perso Dubbing

Lebih dari sekadar vocal remover

😂 Dua mode audio latar

BGM murni, atau BGM dengan tawa dan tepuk tangan tetap utuh. Tidak ada alat pemisah lain yang menawarkan keduanya dari satu unggahan.

👤 Pemisahan multi-pembicara

Bukan sekadar vokal vs musik — pemisahan pembicara memberi setiap orang dalam rekaman treknya sendiri, plus transkrip berlabel pembicara dalam 99+ bahasa.

🔒 Tidak ada yang disimpan

File percobaan diproses di penyimpanan sementara dan dihapus saat sesi berakhir. Tidak pernah disimpan, tidak pernah dipakai untuk pelatihan.

📝 Transkripsi 99+ bahasa

Setiap pemisahan menyertakan speech-to-text otomatis dengan label pembicara, tampil tepat di samping trek Anda. Deteksi bahasa berjalan otomatis — tanpa alat atau langkah tambahan.

🎬 Mendukung audio & video

Unggah MP3, WAV, M4A, MP4, MOV, atau WebM. Ekspor trek dengan subtitle tertanam atau file SRT terpisah.

🎚 Ekspor mix selektif

Gabungkan trek apa pun menjadi satu file — misalnya Musik Latar plus Pembicara 1. Tidak ada alat pemisah lain yang mengekspor mix kustom dalam satu langkah.

Mode Audio Latar Ganda

Dua cara menghapus musik latar atau derau dari video Anda

Tawa di podcast, reaksi penonton, batuk saat presentasi — kebanyakan vocal remover tak bisa membedakannya dari ucapan. Perso Dubbing memberi Anda kedua opsi dari satu unggahan.

MODE 1

Musik Latar

Menghapus semua suara manusia — ucapan, tawa, tepukan — menyisakan hanya suara latar. Ideal untuk BGM bebas hak cipta dan audio bed bersih untuk sulih suara ulang.

🗣 UcapanDIHAPUS
😂 Tawa / Tepuk tanganDIHAPUS
🎵 Musik LatarDIPERTAHANKAN
MODE 2 · Only in Perso Dubbing

Latar dengan Reaksi

Hanya menghapus ucapan, mempertahankan tawa, tepuk tangan, dan energi penonton. Sempurna untuk podcast, acara langsung, dan variety show yang mengutamakan atmosfer.

🗣 UcapanDIHAPUS
😂 Tawa / Tepuk tanganDIPERTAHANKAN
🎵 Musik LatarDIPERTAHANKAN
Pemisahan multi-pembicara

Satu trek per suara — pemisahan pembicara untuk wawancara, podcast, dan rapat

Kebanyakan vocal remover berhenti pada dua stem: vokal dan musik. Pemisahan multi-pembicara Perso Dubbing melangkah lebih jauh — AI mendeteksi berapa banyak orang yang berbicara dan memecah rekaman menjadi trek pembicara individual, masing-masing dengan transkrip berlabel dalam 99+ bahasa.

INPUT

Satu rekaman tercampur

Rekaman wawancara, podcast, atau rapat dengan beberapa orang berbicara di atas musik dan derau ruangan — diunggah sebagai satu file audio atau video.

🎙 Pembicara 1 + Pembicara 2 + MusikTERCAMPUR
OUTPUT · Speaker separation

Trek terpisah untuk setiap pembicara

Pisahkan pembicara dari audio dengan satu klik: ekspor trek satu pembicara, atau kombinasi apa pun yang Anda pilih — tanpa edit manual.

🎤 Pembicara 1TREK SENDIRI
🎤 Pembicara 2TREK SENDIRI
🎵 Musik LatarTREK SENDIRI
Kasus penggunaan

Siapa yang memakai pemisahan audio?

🛡 Penyelesaian hak cipta

Hapus BGM berhak cipta sambil menjaga dialog tetap utuh, ganti dengan musik bebas royalti, dan unggah ulang tanpa klaim.

🎙 Penyuntingan podcast

Potong kata pengisi dan ucapan yang tak diinginkan sambil membiarkan tawa penonton dan reaksi ambient tetap utuh.

🌍 Sulih suara video

Ekstrak trek BGM bersih tanpa bocoran ucapan, lalu tumpangkan voice-over baru dalam salah satu dari 99+ bahasa.

💼 Rapat & konferensi

Pisahkan pembicara dari audio rekaman Zoom atau Meet — setiap peserta mendapat treknya sendiri, lengkap dengan transkrip berlabel pembicara.

📱 Klip media sosial

Ganti BGM asli di video pendek dengan lagu yang sedang tren — tanpa menyentuh voice-over Anda.

🎤 Konser & fancam

Hilangkan riuh penonton dan gema venue dari klip live untuk mengisolasi suara artis atau musiknya.

📰 Jurnalisme & wawancara

Gunakan pemisahan multi-pembicara untuk mengambil suara tiap narasumber dari rekaman lapangan yang bising, dengan transkrip bersih untuk cek fakta.

♻️ Daur ulang konten

Satu unggahan menjadi audio podcast, BGM promosi, klip pembicara untuk media sosial, dan transkrip lengkap untuk blog Anda.

Lakukan lebih banyak di workspace Perso

FAQ

Pertanyaan yang sering diajukan

Apakah Perso Dubbing Audio Separation gratis?
Ya. Anda bisa mengunggah file audio atau video apa pun dan memisahkan 60 detik pertama sepenuhnya gratis, tanpa daftar dan tanpa kartu kredit. Untuk mengunduh hasil atau memproses file lebih dari 60 detik, berlangganan Perso Dubbing. Paket berbayar memperluas batas pemrosesan dan menambah fitur penyuntingan pembicara.
Apakah saya perlu akun untuk mencoba pemisahan audio?
Tidak. Uji coba 60 detik berjalan sepenuhnya tanpa akun. Unggah file, dengarkan setiap trek yang dipisahkan di browser, dan nilai apakah kualitasnya sesuai kebutuhan. Akun hanya diperlukan saat mengunduh hasil atau memproses file yang lebih panjang.
Bagaimana jika file saya lebih dari 60 detik?
File lebih dari 60 detik tetap diterima — AI memproses 60 detik pertama agar Anda bisa menilai kualitas pemisahan dengan konten sendiri. Untuk memisahkan file lengkap, masuk dan unggah ulang file-nya.
Apakah file saya disimpan di server Perso Dubbing?
Tidak. Unggahan uji coba diproses di penyimpanan sementara dan dihapus otomatis saat sesi berakhir. Perso Dubbing tidak menyimpan, memakai ulang, atau melatih model dengan file dari uji coba gratis.
Format dan ukuran file apa yang didukung?
Perso Dubbing menerima file audio MP3, WAV, dan M4A serta video MP4, MOV, dan WebM, hingga 200MB per unggahan. File video ditangani otomatis — AI mengekstrak audionya dan memisahkannya.
Apa beda mode Musik Latar dan Latar dengan Reaksi?
Musik Latar menghapus semua suara manusia — ucapan, tawa, tepuk tangan — dan menyisakan hanya suara latar murni. Latar dengan Reaksi hanya menghapus ucapan sambil mempertahankan tawa, tepuk tangan, dan suara penonton, sehingga atmosfer langsung podcast dan rekaman acara tetap terjaga. Perso Dubbing menghasilkan kedua trek dari satu unggahan.
Bisakah Perso Dubbing melakukan pemisahan multi-pembicara, bukan hanya vokal dan musik?
Bisa. Selain memisahkan vokal/musik, Perso Dubbing menjalankan pemisahan pembicara penuh (juga disebut speaker split): AI mendeteksi setiap pembicara dalam rekaman dan menghasilkan trek terpisah per pembicara, beserta transkrip berlabel pembicara dalam 99+ bahasa. Cocok untuk wawancara, podcast, dan rekaman rapat — bukan hanya musik.
Seberapa akurat pemisahan audio Perso Dubbing dibanding alat lain?
Pada benchmark standar MUSDB18, Perso Dubbing memisahkan vokal lebih bersih daripada HTDemucs milik Meta di 44 dari 50 trek (10.67 vs 8.36 dB SI-SDR median). Pada denoising VoiceBank-DEMAND, ia menyamai spesialis DeepFilterNet3 dan mengungguli ElevenLabs Audio Isolation di 92-100% sampel. Hasil per sampel dipublikasikan agar siapa pun bisa memverifikasi angkanya.
Bisakah saya menghapus musik berhak cipta dari video saya?
Bisa. Unggah video Anda, biarkan AI memisahkan trek audionya, lalu ekspor hanya trek vokal dan pembicara tanpa musik latar. Ini cara tercepat menyelesaikan klaim hak cipta di YouTube, TikTok, atau Instagram tanpa merekam ulang konten.
Bagaimana cara menghapus musik latar dari video yang saya rekam sendiri?
Unggah file video secara langsung — tidak perlu mengekstrak audionya dulu. Perso Dubbing memisahkan ucapan, musik latar, dan suara sekitar menjadi trek terpisah: ekspor mix khusus ucapan untuk membuang musik, atau simpan kombinasi mana pun yang Anda inginkan. Mendukung MP4, MOV, dan WebM, dan 60 detik pertama gratis.
Apa beda Perso Dubbing dengan LALAL.AI atau Moises?
Alat musik memisahkan vokal dan instrumen — lalu berhenti di situ. Perso Dubbing menggabungkan pemisahan dengan transkripsi 99+ bahasa, penataan ulang pembicara, dua mode audio latar, dan pencampuran trek selektif dalam satu alur kerja — dibuat untuk kreator video dan editor konten, bukan hanya musisi.
Bisakah saya menggabungkan trek terpilih menjadi satu file?
Bisa. Pilih kombinasi trek terpisah apa pun — misalnya Musik Latar plus Pembicara 1 — dan ekspor sebagai satu file audio gabungan. Ekspor mix selektif ini hanya ada di Perso Dubbing.

Coba dengan file Anda sendiri — sekarang juga

60 detik pertama gratis. Tanpa daftar, tanpa file tersimpan, tanpa syarat tersembunyi.

↑ Unggah file