如何從同一段錄音中分離兩個人的聲音

人工智能視頻翻譯、定位和配音工具
免費試用
要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。
Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。
本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。
01. 依錄音情況選擇方法
手邊素材 | 建議起點 | 主要限制 |
|---|---|---|
原始麥克風或錄音音軌 | 單獨播放並匯出所需人物的原始音軌 | 麥克風可能同時收進另一個人的聲音。 |
交替說話的混合錄音 | 在時間軸剪掉或靜音不需要的發言 | 無法隔離同時出現的聲音。 |
說話重疊的混合錄音 | 用短片段測試個別說話者分離 | 必須檢查漏字與另一個聲音的殘留。 |

這是方法選擇示意圖,不是產品截圖或效能測量結果。
情況 1:你有原始音軌
開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。
立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。
情況 2:兩人輪流說話
如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。
例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。
情況 3:兩人同時說話
將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。
重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。
02. 說話者標籤不等於獨立音軌
說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。
說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。
人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。
03. 在 Perso Dubbing 檢查個別說話者音軌
1. 選擇有代表性的片段
納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。
2. 上傳檔案
開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。
3. 找到需要的輸出
處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。
聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。
4. 比較困難的片段
播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。
5. 匯出並回到影片編輯器
匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。
匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。
04. 使用結果前應聆聽的項目
檢查項目 | 留意內容 | 處理方式 |
|---|---|---|
需要的話語 | 音節、子音缺失或意思改變 | 與原始的同一句比較。重要字詞消失時不要採用。 |
其他說話者 | 目標聲音下仍有第二個聲音 | 判斷是否需要其他剪輯方式或原始獨立錄音。 |
打斷 | 同時說話時聲音變弱或失真 | 將重疊片段與清楚的輪流發言分開檢查。 |
音色 | 金屬聲、突然變化、音量不均 | 用耳機及觀眾常用的裝置聆聽。 |
時間 | 語音比嘴型早或晚 | 重新檢查音軌對齊與剪輯時的裁切。 |
一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。
05. 重疊發言需要檢查的限制
內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。
然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。
實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。
06. 如果仍然聽到聲音重疊
請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。
逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。
確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。
07. 常見問題
Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。
Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。
Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。
用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。
要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。
Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。
本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。
01. 依錄音情況選擇方法
手邊素材 | 建議起點 | 主要限制 |
|---|---|---|
原始麥克風或錄音音軌 | 單獨播放並匯出所需人物的原始音軌 | 麥克風可能同時收進另一個人的聲音。 |
交替說話的混合錄音 | 在時間軸剪掉或靜音不需要的發言 | 無法隔離同時出現的聲音。 |
說話重疊的混合錄音 | 用短片段測試個別說話者分離 | 必須檢查漏字與另一個聲音的殘留。 |

這是方法選擇示意圖,不是產品截圖或效能測量結果。
情況 1:你有原始音軌
開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。
立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。
情況 2:兩人輪流說話
如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。
例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。
情況 3:兩人同時說話
將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。
重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。
02. 說話者標籤不等於獨立音軌
說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。
說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。
人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。
03. 在 Perso Dubbing 檢查個別說話者音軌
1. 選擇有代表性的片段
納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。
2. 上傳檔案
開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。
3. 找到需要的輸出
處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。
聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。
4. 比較困難的片段
播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。
5. 匯出並回到影片編輯器
匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。
匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。
04. 使用結果前應聆聽的項目
檢查項目 | 留意內容 | 處理方式 |
|---|---|---|
需要的話語 | 音節、子音缺失或意思改變 | 與原始的同一句比較。重要字詞消失時不要採用。 |
其他說話者 | 目標聲音下仍有第二個聲音 | 判斷是否需要其他剪輯方式或原始獨立錄音。 |
打斷 | 同時說話時聲音變弱或失真 | 將重疊片段與清楚的輪流發言分開檢查。 |
音色 | 金屬聲、突然變化、音量不均 | 用耳機及觀眾常用的裝置聆聽。 |
時間 | 語音比嘴型早或晚 | 重新檢查音軌對齊與剪輯時的裁切。 |
一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。
05. 重疊發言需要檢查的限制
內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。
然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。
實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。
06. 如果仍然聽到聲音重疊
請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。
逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。
確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。
07. 常見問題
Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。
Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。
Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。
用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。
要分離同一段錄音中的兩個聲音,請優先使用原始的個別說話者音軌。如果沒有,可嘗試按說話者分離音訊,並在編輯前檢查兩個輸出。
Podcast 來賓聲音太小、訪問者打斷回答,或你只想將一個人的話用於短片。如果聲音混在同一個檔案中,下一步取決於手邊還有錄音專案、個別麥克風音軌,還是只有匯出的音訊或影片。
本指南協助你選擇方法、檢查分離結果,並將需要的聲音放回剪輯中。如果目的是去掉對話背後的音樂,請先閱讀背景音樂移除指南。
01. 依錄音情況選擇方法
手邊素材 | 建議起點 | 主要限制 |
|---|---|---|
原始麥克風或錄音音軌 | 單獨播放並匯出所需人物的原始音軌 | 麥克風可能同時收進另一個人的聲音。 |
交替說話的混合錄音 | 在時間軸剪掉或靜音不需要的發言 | 無法隔離同時出現的聲音。 |
說話重疊的混合錄音 | 用短片段測試個別說話者分離 | 必須檢查漏字與另一個聲音的殘留。 |

這是方法選擇示意圖,不是產品截圖或效能測量結果。
情況 1:你有原始音軌
開啟原始錄音專案,單獨播放需要的人所使用的麥克風音軌。確認是否仍有其他人的聲音串入,再匯出可用音軌。這能避免從完成的混音中重建聲音。
立體聲有兩個聲道,但不一定各自對應一個人。先分別聽左右聲道,再判斷是否為獨立說話者。
情況 2:兩人輪流說話
如果只需要部分發言,時間軸編輯可能就足夠。保留目標人物的片段,降低或靜音其他片段。保留每個字的開頭與結尾,並檢查剪接處的環境聲是否突然變化。
例如,從問答製作只有來賓的短片時,只有在回答本身仍能成立的情況下才刪除問題。如果移除問題會改變意思,請保留脈絡。
情況 3:兩人同時說話
將重疊的時間範圍靜音,會同時移除兩個聲音。請改用短片段測試說話者分離,並在同一時間點將各輸出與原始音訊比較。
重要語句缺失時,可改用其他拍攝版本、索取原始麥克風音軌,或選擇沒有打斷的片段。不要因為工具輸出兩個音軌,就認為所有字都已復原。
02. 說話者標籤不等於獨立音軌
說話者分段是在逐字稿中辨識誰在何時說話。例如,Google Cloud 的說話者分段文件說明如何將說話者標籤與辨識出的字詞關聯。這本身不會產生只含一個人聲音的可下載音訊檔。
說話者音訊分離則以產生個別聲音音軌為目標。選工具前,先確認實際輸出。標有 Speaker 1、Speaker 2 的逐字稿有助於文字編輯,但原始音訊可能仍混在一起。
人聲音軌又是另一種輸出:降低背景聲後,仍可能保留兩人的聲音。詳見音樂人聲移除與影片音訊分離的差異。
03. 在 Perso Dubbing 檢查個別說話者音軌
1. 選擇有代表性的片段
納入每個人清楚的一句話,以及錄音中若有的打斷情境。保留原始檔供比較。只測試簡單的開場句,無法判斷最複雜的片段是否可用。
2. 上傳檔案
開啟 Perso Dubbing Audio Separation,使用上傳區域。處理前確認頁面目前列出的檔案要求與試用條件。
3. 找到需要的輸出
處理後檢查可用音軌。需要一個人的聲音時,選個別說話者音軌。「All Speakers (Vocals)」指所有說話者合在一起的聲音,而非單一人物。
聆聽編號音軌,確認各自代表誰。不要假設 Speaker 1 永遠是主持人,也不要認為偵測出的音軌已可直接發布。
4. 比較困難的片段
播放打斷前後的原始音訊和各說話者音軌,再檢查較安靜的句子及字尾。使用下方清單判斷結果是否適合剪輯。
5. 匯出並回到影片編輯器
匯出選單列有說話者 WAV 音訊。9 月 29 日檢查時,下載提示顯示 Starter 方案可使用音軌下載;不能將免費註冊等同於免費下載。登入後工作區的 Audio Export 會將選取的音軌合成一個檔案。要匯出單一說話者,請取消其他音軌,並確認 Selected 只顯示該說話者。製作影片時,將音訊放入編輯器、與原片對齊,再將原始混合音訊靜音,以免另一個聲音重新混入。
匯出影片前,檢查開頭和後段的同步。音訊分離與影片匯出是這個流程中的兩個步驟。
04. 使用結果前應聆聽的項目
檢查項目 | 留意內容 | 處理方式 |
|---|---|---|
需要的話語 | 音節、子音缺失或意思改變 | 與原始的同一句比較。重要字詞消失時不要採用。 |
其他說話者 | 目標聲音下仍有第二個聲音 | 判斷是否需要其他剪輯方式或原始獨立錄音。 |
打斷 | 同時說話時聲音變弱或失真 | 將重疊片段與清楚的輪流發言分開檢查。 |
音色 | 金屬聲、突然變化、音量不均 | 用耳機及觀眾常用的裝置聆聽。 |
時間 | 語音比嘴型早或晚 | 重新檢查音軌對齊與剪輯時的裁切。 |
一段清楚的音訊不能代表整段錄音都通過驗證。短訪談中,一個受損的回答可能比數分鐘清楚的聲音更重要。
05. 重疊發言需要檢查的限制
內部測試使用兩個合成聲音製作約 19 秒的錄音,第二個聲音從 6.5 秒開始。登入工作區後,結果提供兩個說話者選項、帶標籤的逐字稿,以及兩個與輸入長度近似的 WAV 檔。
然而,標示 Speaker 2 的輸出在 6.5 至 10 秒是數位靜音。因此,兩個匯出檔案的存在不能證明重疊聲音已完整復原。我們尚未完成聆聽評估或驗證聲音與音軌的對應。這只是單一合成樣本的訊號觀察,不是實際訪談的效能基準,也不是分離成功示範。
實用的做法是將需要的每一句與原音比較,尤其是互相打斷的位置。檔案保留完整時長,不代表內部沒有缺少發言。
06. 如果仍然聽到聲音重疊
請用自己的檔案評估分離結果。如果需要的話語遺失,或第二個聲音仍干擾收聽,可考慮其他片段、原始麥克風錄音,或在可行時重新錄製。不要將受損句子當成準確的發言記錄。
逐字稿或配音除了檢查聲音,也要檢查說話者歸屬。獨立音軌不代表轉錄或翻譯正確。多說話者轉錄指南介紹標籤與腳本審查。
確認原始素材可用後,再進入影片配音。音訊分離檢查與翻譯腳本檢查應分別判斷。
07. 常見問題
Q. 可以分離同時說話的兩個聲音嗎?
A. 可以對混合錄音嘗試說話者分離,但要檢查每個輸出的重疊片段。有兩個標籤不代表兩個聲音都完整清楚地保留。請保留原音來比較字詞與聲音。
Q. 人聲移除工具可以從訪談中隔離一個人嗎?
A. 先確認工具如何定義「人聲」。聲音與音樂分離的輸出,可能仍包含兩個人。需要個別處理時,請找說話者音訊輸出並逐一聆聽。逐字稿標籤並不等於分離音軌。
Q. 可以將結果下載為影片嗎?
A. 本文說明的說話者下載是 WAV 音訊。完成影片需將所選音訊放入影片編輯器、與畫面对齊,並靜音原始混合音訊。9 月 29 日確認的下載提示顯示,音軌下載在 Starter 方案提供。
用自己的錄音試試 Audio Separation。開始完整剪輯前,先比較困難的片段。
繼續閱讀
瀏覽全部
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618





