分離人聲、說話者與音樂
免費、線上、數秒完成
拍攝時剛好有音樂在播放?背景混入了不想要的雜訊?在下方放入任何音訊或影片檔,Perso Dubbing 會將它分離為人聲、個別說話者與背景音樂,讓您在註冊前就能試聽每一軌。
無需註冊 · 前 60 秒免費 · 檔案絕不儲存
點擊或拖放您的檔案
立即開始分離 — 無需帳號(最大 200MB)
沒有檔案?試試範例:
正在分離音軌...
正在分析聲音頻率,將人聲與周圍背景元素分離
在工作區可逐句編輯講者字幕稿
今日免費額度已用完
今天的 3 次免費分離已用完。免費註冊即可繼續使用。
Starter 方案不受每日次數限制。
世界級效能 — 用數據證明,而非空口宣稱
三項業界標準公開基準測試 — 人聲分離用 MUSDB18、語音降噪用 VoiceBank-DEMAND、轉錄用 Open ASR Leaderboard。與每篇研究論文相同的資料集,對比具名引擎,並公開逐樣本數據,任何人都能重跑測試。
人聲分離 越高越好
50 條音軌中贏 44 條 — 即使落敗,差距最多也只有 0.66 dB。
降噪品質 越高越好
專精降噪的 DeepFilterNet3 以毫釐領先(2.77 對 2.64)— 兩者都遠超 ElevenLabs。
語音清晰度 越高越好
前兩名實際上不相上下。ElevenLabs 在一半樣本中讓語音更難聽清 — 我們則在 96% 的樣本中讓它更清晰。
語音克隆保真度 越高越好
在兩套受測克隆系統中均居首位 — 即使在 ElevenLabs 自家的克隆器內也是。條紋柱是乾淨原音:天然的上限。
轉錄準確度(WER) 越低越好
整體與 Scribe v2 統計持平 — 但在播客等多人對話內容上,我們勝出(柱越短 = 錯誤越少)。
長條圖已放大至競爭區間,讓微小差距保持可見 — 真正作準的是每條旁的精確數字。
這些測試究竟在衡量什麼?
🎯 人聲分離(SI-SDR) 越高越好
人聲與音樂分離得有多乾淨 — 就像提取一條完全不殘留人聲的卡拉OK音軌。我們的分數:10.67 dB,HTDemucs 為 8.36 dB — 音軌之間串音更少,50 首歌中贏了 44 首。
🔊 降噪(PESQ · ESTOI) 越高越好
去除噪音後語音聽起來有多清晰自然 — 與評估通話品質相同的指標。我們得到 2.64,僅以毫釐之差落後專精降噪的 DeepFilterNet3(2.77),大幅領先 ElevenLabs(2.38)。在清晰度上,我們並列第一。
📝 轉錄準確度(WER) 越低越好
每 100 個口說詞彙中,有多少被寫錯。我們的 7.61% 意味著 100 個詞約有 92 個正確 — 與 ElevenLabs Scribe v2(7.52%)在統計上相當,在播客等多人對話錄音中則更勝一籌。
🎤 語音克隆保真度(cos_sim) 越高越好
清理後,用該音訊建立的語音克隆聽起來還像同一個人嗎?以 0 到 1 對照原聲評分。我們的 0.674 在兩套受測克隆系統中均排名第一 — 包括在 ElevenLabs 自家的克隆器裡。
誠實註記:人聲分離以 MUSDB18 樣本集測得(MUSDB18-HQ 完整重測進行中,預期誤差 ±0.5 dB 內)。DeepFilterNet3 在 PESQ 上以 0.15 領先 — 清晰度我們持平,波形保真度我們領先(+18.66 對 +17.31 dB SI-SDR)。MDX-Net 與 LALAL.AI 尚未測試,因此我們不宣稱勝過所有分離工具。2026 年 5 月驗證。
三個步驟,一分鐘內完成
上傳檔案
拖放音訊或影片檔 — MP3、WAV、M4A、MP4、MOV 或 WebM,最大 200MB。前 60 秒無需帳戶。
試聽分離音軌
AI 將檔案拆分為各個說話者、純背景音樂,以及含反應的背景。每條音軌都能直接在瀏覽器播放。
匯出混音
挑選所需音軌,匯出為單一檔案。登入即可下載,或完整處理較長的檔案。
不只是人聲移除工具
😂 雙背景音模式
純背景音樂,或保留笑聲與掌聲的背景音樂。沒有其他分離工具能在一次上傳中同時提供兩者。
👤 多說話者分離
不只是「人聲對音樂」— 說話者分離讓錄音中的每個人都有自己的音軌,還附上支援 99+ 種語言、標註說話者的逐字稿。
🔒 不儲存任何內容
試用檔案在暫存空間處理,工作階段結束即刪除。絕不保留,也絕不用於訓練。
📝 99+ 種語言轉錄
每次分離都包含自動語音轉文字與說話者標註,就顯示在音軌旁。語言自動偵測 — 無需額外工具或步驟。
🎬 音訊影片皆可
上傳 MP3、WAV、M4A、MP4、MOV 或 WebM。可匯出內嵌字幕的音軌,或另存 SRT 字幕檔。
🎚 自選混音匯出
將任意音軌合併為一個檔案 — 例如背景音樂加說話者 1。沒有其他分離工具能一步匯出客製混音。
移除影片背景音樂或雜訊的兩種方式
播客的笑聲、觀眾的反應、主題演講中的咳嗽 — 多數人聲移除工具無法將它們與語音區分。Perso Dubbing 讓您一次上傳,同時獲得兩種選擇。
背景音樂
移除所有人聲 — 說話、笑聲、拍手 — 只留下背景音。適合無版權疑慮的 BGM 與重新配音用的乾淨音底。
含反應背景
只移除說話聲,保留笑聲、掌聲與現場氣氛。最適合播客、現場活動與講究氛圍的綜藝節目。
每個聲音一條音軌 — 為訪談、播客與會議打造的說話者分離
多數人聲移除工具只做到兩軌:人聲與音樂。Perso Dubbing 的多說話者分離更進一步——AI 會偵測有多少人在說話,將錄音拆分成各個說話者的獨立音軌,每軌都附上支援 99+ 種語言的標註逐字稿。
一段混合錄音
一段訪談、播客或會議錄音,多人在音樂與環境噪音中交談——以單一音訊或影片檔上傳。
每位說話者一條獨立音軌
一鍵從音訊中分離說話者:可只匯出單一說話者的音軌,或任選組合——無需手動編輯。
誰在使用音訊分離?
🛡 解決版權爭議
移除受版權保護的背景音樂並完整保留對白,換上免版稅音樂,重新上傳不再收到版權聲明。
🎙 播客剪輯
剪掉贅詞與不需要的語音,同時完整保留觀眾笑聲與現場反應。
🌍 影片配音
提取零語音殘留的乾淨背景音樂,再疊上 99 種以上語言任選的新旁白。
💼 會議與研討會
從 Zoom 或 Meet 錄音的音訊中分離說話者——每位與會者都有自己的音軌,並內建說話者標註逐字稿。
📱 社群短影音
把短影音裡的原背景音樂換成時下流行曲 — 完全不動您的旁白。
🎤 演唱會與飯拍
去除現場片段中的人群噪音與場地殘響,突顯歌手的聲音或音樂本身。
📰 新聞與訪談
運用多說話者分離,從嘈雜的實地錄音中提取每位受訪者的聲音,並附上乾淨逐字稿以便查證。
♻️ 內容再利用
一次上傳,化為播客音訊、宣傳 BGM、社群用說話者短片,以及部落格用的完整逐字稿。
在 Perso 工作區做更多
EN
KO
ES
PT
RU
ID
DE
TH
JP
TC