產品指南

如何從同一段錄音中分離兩個人的聲音

跳到部分

跳到部分

分享

分享

分享

人工智能視頻翻譯、定位和配音工具

免費試用

要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。

Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。

本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。

01. 依錄音情況選擇方法

手邊素材

建議起點

主要限制

原始麥克風或錄音音軌

單獨播放並匯出所需人物的原始音軌

麥克風可能同時收進另一個人的聲音。

交替說話的混合錄音

在時間軸剪掉或靜音不需要的發言

無法隔離同時出現的聲音。

說話重疊的混合錄音

用短片段測試個別說話者分離

必須檢查漏字與另一個聲音的殘留。

選擇原始音軌、時間軸編輯或說話者分離的流程圖。

這是方法選擇示意圖,不是產品截圖或效能測量結果。

情況 1:你有原始音軌

開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。

立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。

情況 2:兩人輪流說話

如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。

例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。

情況 3:兩人同時說話

將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。

重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。

02. 說話者標籤不等於獨立音軌

說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。

說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。

人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。

03. 在 Perso Dubbing 檢查個別說話者音軌

1. 選擇有代表性的片段

納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。

2. 上傳檔案

開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。

3. 找到需要的輸出

處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。

聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。

4. 比較困難的片段

播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。

5. 匯出並回到影片編輯器

匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。

匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。

04. 使用結果前應聆聽的項目

檢查項目

留意內容

處理方式

需要的話語

音節、子音缺失或意思改變

與原始的同一句比較。重要字詞消失時不要採用。

其他說話者

目標聲音下仍有第二個聲音

判斷是否需要其他剪輯方式或原始獨立錄音。

打斷

同時說話時聲音變弱或失真

將重疊片段與清楚的輪流發言分開檢查。

音色

金屬聲、突然變化、音量不均

用耳機及觀眾常用的裝置聆聽。

時間

語音比嘴型早或晚

重新檢查音軌對齊與剪輯時的裁切。

一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。

05. 重疊發言需要檢查的限制

內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。

然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。

實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。

06. 如果仍然聽到聲音重疊

請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。

逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。

確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。

07. 常見問題

Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。

Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。

Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。

用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。

要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。

Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。

本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。

01. 依錄音情況選擇方法

手邊素材

建議起點

主要限制

原始麥克風或錄音音軌

單獨播放並匯出所需人物的原始音軌

麥克風可能同時收進另一個人的聲音。

交替說話的混合錄音

在時間軸剪掉或靜音不需要的發言

無法隔離同時出現的聲音。

說話重疊的混合錄音

用短片段測試個別說話者分離

必須檢查漏字與另一個聲音的殘留。

選擇原始音軌、時間軸編輯或說話者分離的流程圖。

這是方法選擇示意圖,不是產品截圖或效能測量結果。

情況 1:你有原始音軌

開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。

立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。

情況 2:兩人輪流說話

如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。

例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。

情況 3:兩人同時說話

將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。

重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。

02. 說話者標籤不等於獨立音軌

說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。

說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。

人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。

03. 在 Perso Dubbing 檢查個別說話者音軌

1. 選擇有代表性的片段

納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。

2. 上傳檔案

開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。

3. 找到需要的輸出

處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。

聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。

4. 比較困難的片段

播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。

5. 匯出並回到影片編輯器

匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。

匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。

04. 使用結果前應聆聽的項目

檢查項目

留意內容

處理方式

需要的話語

音節、子音缺失或意思改變

與原始的同一句比較。重要字詞消失時不要採用。

其他說話者

目標聲音下仍有第二個聲音

判斷是否需要其他剪輯方式或原始獨立錄音。

打斷

同時說話時聲音變弱或失真

將重疊片段與清楚的輪流發言分開檢查。

音色

金屬聲、突然變化、音量不均

用耳機及觀眾常用的裝置聆聽。

時間

語音比嘴型早或晚

重新檢查音軌對齊與剪輯時的裁切。

一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。

05. 重疊發言需要檢查的限制

內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。

然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。

實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。

06. 如果仍然聽到聲音重疊

請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。

逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。

確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。

07. 常見問題

Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。

Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。

Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。

用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。

要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。

Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。

本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。

01. 依錄音情況選擇方法

手邊素材

建議起點

主要限制

原始麥克風或錄音音軌

單獨播放並匯出所需人物的原始音軌

麥克風可能同時收進另一個人的聲音。

交替說話的混合錄音

在時間軸剪掉或靜音不需要的發言

無法隔離同時出現的聲音。

說話重疊的混合錄音

用短片段測試個別說話者分離

必須檢查漏字與另一個聲音的殘留。

選擇原始音軌、時間軸編輯或說話者分離的流程圖。

這是方法選擇示意圖,不是產品截圖或效能測量結果。

情況 1:你有原始音軌

開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。

立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。

情況 2:兩人輪流說話

如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。

例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。

情況 3:兩人同時說話

將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。

重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。

02. 說話者標籤不等於獨立音軌

說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。

說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。

人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。

03. 在 Perso Dubbing 檢查個別說話者音軌

1. 選擇有代表性的片段

納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。

2. 上傳檔案

開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。

3. 找到需要的輸出

處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。

聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。

4. 比較困難的片段

播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。

5. 匯出並回到影片編輯器

匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。

匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。

04. 使用結果前應聆聽的項目

檢查項目

留意內容

處理方式

需要的話語

音節、子音缺失或意思改變

與原始的同一句比較。重要字詞消失時不要採用。

其他說話者

目標聲音下仍有第二個聲音

判斷是否需要其他剪輯方式或原始獨立錄音。

打斷

同時說話時聲音變弱或失真

將重疊片段與清楚的輪流發言分開檢查。

音色

金屬聲、突然變化、音量不均

用耳機及觀眾常用的裝置聆聽。

時間

語音比嘴型早或晚

重新檢查音軌對齊與剪輯時的裁切。

一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。

05. 重疊發言需要檢查的限制

內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。

然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。

實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。

06. 如果仍然聽到聲音重疊

請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。

逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。

確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。

07. 常見問題

Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。

Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。

Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。

用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。

繼續閱讀

瀏覽全部

2026年最佳免費 AI 影片翻譯工具(8 款工具實測)
Product Guide

2026年最佳免費 AI 影片翻譯工具(8 款工具實測)

成長負責人及產品擁有者Untae Bae

Untae Bae

成長主管與產品擁有人

什麼是 AI 對嘴?— Perso 配音產品指南
Product Guide

什麼是 AI 對嘴?其運作原理、工具與用途

成長行銷人員 Hyesun Shin

Hyesun Shin

成長行銷人員

Dentalbean 使用 Perso Dubbing 將韓文牙齒矯正培訓在地化,提供給全球牙醫,將配音成本降低 95~99%,同時保留講師的聲音。查看完整案例。
Customer Stories

結合 AI 配音的全球醫學教育

Business Development Hyeram Lee

Hyeram Lee

業務發展