產品指南

如何移除影片背景音樂又保留人聲

跳到部分

跳到部分

分享

分享

分享

人工智能視頻翻譯、定位和配音工具

免費試用

要移除影片的背景音樂又保留說話聲,你得依照聲音的種類來分離音訊,而不是依照時間。把一段靜音,聲音會連人聲一起帶走。AI 音訊分離會把檔案拆成音樂軌和語音軌,讓你只匯出語音。

以上是簡短答案。至於你該用哪一種方法,其實只取決於一件事:原始音訊是否還以獨立音軌的形式存在。多數人都沒有,這也是為什麼這件事比看起來麻煩。

為什麼靜音行不通

直覺是找到有音樂的那段把它靜音。這行不通,原因很明確。

成片的音訊是一層混好的單一波形。音樂、你的聲音、房間的聲音,以及其他所有聲音,全都加總在同一條波形裡。底下並沒有一條音樂軌等著你去關掉。把一段靜音,那段裡的所有東西都會消失,包括你需要的那些話。

所以當音樂不間斷地鋪在說話聲底下時特別棘手,也就是咖啡廳拍攝、店內走動、健身房短片、研討會錄影這些情況。根本沒有可以下刀的空隙。

四種方法,以及各自適用的情況


方法

適用條件

成本

在剪輯軟體裡靜音音樂軌

原始專案裡音軌還是分開的

免費,但很少有

YouTube 工作室的歌曲工具

音樂造成了著作權主張

免費

Audacity 中央聲道技巧

檔案是真正的立體聲,音樂散在兩側

免費,但手機影片無效

AI 音訊分離

任何混好的檔案,包括單聲道手機影片

試用免費

方法一:在剪輯軟體裡靜音音樂軌

如果音樂是你自己在 Premiere、Final Cut、DaVinci Resolve 或剪映裡加上去的,而且專案檔還在,那就別往下讀了。打開專案,找到音樂軌,刪掉,匯出。

這是唯一零品質損失的方法,因為你不是從混音裡把東西剝出來,而是在混音發生之前就把那一層拿掉。

前提是音樂是後期加的,而且專案還在。如果音樂是拍攝當下就在現場,或你手上只有匯出的 MP4,請直接跳到方法四。

方法二:如果是因為著作權主張,先用 YouTube 工作室

如果你想拿掉音樂是因為 Content ID 主張,YouTube 工作室的編輯器裡就有內建的歌曲工具。它免費、不需要別的東西,先試它。

創作者指出的限制跟前面一樣:把被主張的片段靜音會連聲音一起帶走,而自動移除歌曲在說話聲密集鋪底的段落,不見得能穩定留下可用的音訊。YouTube 的工具一直在變,依賴它之前請先確認 YouTube 說明中心的最新指引。

如果結果不堪用,用方法四的檔案層級做法把對話拿回來,再換上已授權的音樂重新上傳就行。主張的處理流程我們在解決背景音樂著作權主張的指南裡談得更完整。

方法三:Audacity 中央聲道技巧,以及它為什麼常讓人失望

這是多數舊教學會教的方法,值得了解它為什麼會讓你失望。

Audacity 的人聲消除靠的是立體聲的空間位置,不是聲音辨識。在錄音室的音樂混音裡,主唱通常被擺在正中央,樂器散在左右。把其中一個聲道反相疊上去,中央的內容就互相抵消。

用在影片上有三個問題:

  • 它消掉的是相反的東西。 這個技巧抵消的是「置中」的內容。在影片裡,置中的是你的聲音,不是音樂。你會得到跟需求完全相反的結果。

  • 手機影片基本上是單聲道。 左右兩聲道幾乎是同一份音訊,沒有立體聲差異可以利用。這個技巧沒有東西可以運作,結果是一片安靜或根本沒變。

  • 真實空間不是錄音室混音。 從咖啡廳喇叭漏出來的音樂並沒有整齊地分到兩側,它到處都是,包括正中央。

搜尋數據也印證了這點:Audacity 式人聲消除的關注度年減幅度很大,而 AI 工具正在上升。這個方法在真正的立體聲音樂檔案上仍有它的位置,但對影片素材來說它不是對的工具。

方法四:AI 音訊分離

這是通用解,也是唯一能處理「音樂鋪在說話聲底下的單聲道 MP4」的方法。

它不靠立體聲位置,而是讓 AI 學會辨識不同種類的聲音長什麼樣子,再把它們拆成獨立音軌。語音成為一軌,背景音樂和環境音成為另一軌。接著你只匯出你要的。

Perso Dubbing

  1. 上傳影片檔。 不需要先抽出音訊。MP4、MOV、WebM 可直接處理,MP3、WAV、M4A 也一樣,單檔最大 200MB。

  2. 交給它分離。 檔案會拆成語音、個別說話者的聲音、背景音樂和環境音。

  3. 聽語音軌。 播放時專心聽音樂有沒有從底下滲出來。結果能不能用,就看這一步。

  4. 只匯出語音,帶回剪輯軟體,需要的話再加上已授權的音樂。

決定成品乾淨或混濁的,是分離品質。在這項任務的標準公開測試集 MUSDB18 上,Perso Dubbing 的 SI-SDR 中位數為 10.67 dB,勝過 Meta 的 HTDemucs(8.36 dB),在 50 首中贏了 44 首。每個樣本的結果都已公開,任何人都能自行重跑驗證。數據為 2026 年 5 月。

付費前可以用自己的檔案確認。前 60 秒不需註冊即可免費分離,試用檔案在工作階段結束後刪除。

用你自己的影片試試 →

你得到什麼,又失去什麼

多數教學會跳過這段,所以這裡直說。

當你匯出只有語音的音軌時,音樂沒了。房間也沒了。觀眾的笑聲、掌聲、街上的聲音、現場的殘響,全都和音樂待在同一個背景層,會跟著一起離開。

如果是咖啡廳放著音樂的談話類短片,這正是你要的:乾淨,音樂消失。

如果是活動側記、演講或脫口秀,只有語音的版本可能聽起來扁平,跟畫面對不上。兩種處理方式:

  • 在剪輯軟體裡把環境音補回去。 在對話底下鋪一層淡淡的室內底噪或觀眾聲,感覺就回來了。

  • 保留背景而不是語音。 Perso Dubbing 從一次上傳會產生兩種背景音軌。Background Music 給你剝除所有人聲後的純音樂與環境音;Background with Reaction 會把笑聲和掌聲連同音樂一起留下。當你要的是氛圍而不是話語時,用這兩軌。不過要注意,兩者都含音樂,所以當音樂本身就是問題時,它們都不是解方。

如果你只想調小聲,而不是拿掉

有時候音樂本身沒問題,只是在對話底下太大聲。

如果你有專案檔,這是音量自動化的工作:有人說話時把音樂軌壓低幾 dB 就好。每套剪輯軟體都有。

如果你只有成片,你沒辦法把一個不以圖層形式存在的東西調小。路徑一樣:先把音軌分離,再照你要的比例重新混。Perso Dubbing 可以把選定的音軌合併成單一檔案匯出,所以你能把語音搭配一條安靜下來的背景,而不是把它整個丟掉。

在 iPhone 上移除影片背景音樂

iOS 沒有內建功能能把成片裡的音樂和語音分開。照片 App 和 iMovie 可以把音訊靜音,但那又回到前面說的全有全無問題。

手機上實際可行的路是瀏覽器版的分離工具。從手機上傳影片,等分離完成,下載語音軌。什麼都不用裝。

順帶一提:把音訊整理乾淨

移除音樂常常只做了一半。如果錄音還有嘶聲、電流聲或房間回音,那是另一件事,叫降噪,而且要在分離之後對語音軌做,不是之前。近幾個月大家對整理影片音訊的關注度明顯上升,理由大概和分離一樣:工具終於能在真實素材上運作,而不是只能處理錄音室檔案。

順序很重要。先分離,再對分離出來的語音降噪。先對混好的檔案降噪,往往會把音樂糊進人聲裡,反而讓後面的分離變差。

常見問題

怎麼移除影片背景音樂又保留人聲?

依聲音種類分離音訊,然後只匯出語音軌。成片的音訊是一層混好的單一波形,而不是音樂和語音各自分開,所以靜音會把那個時間範圍裡的人聲一起消掉。AI 分離會把這層混音拆成獨立音軌,因此可以單獨保留語音。

可以免費移除影片背景音樂嗎?

一定程度上可以。如果你有原始專案檔,在剪輯軟體裡刪掉音樂軌是免費且零損失的。如果你只有匯出的檔案,Perso Dubbing 前 60 秒免費分離且不需註冊,足以判斷語音能不能乾淨地留下來。

為什麼移除背景音樂連觀眾的聲音也不見了?

因為笑聲、掌聲和現場殘響屬於背景層,不屬於語音層。只匯出語音時它們會全部一起消失。如果你需要現場感,可以在剪輯軟體裡補回室內底噪,或另外匯出背景軌,用比較低的音量混進去。

Audacity 的方法對影片有用嗎?

通常沒用。它抵消的是立體聲場中置中的內容,而影片裡置中的是人聲不是音樂;而且手機影片接近單聲道,沒有立體聲差異可以利用。它適合真正的立體聲音樂檔案,不適合拍攝素材。

不重拍要怎麼把影片的 BGM 拿掉?

把影片上傳到 AI 分離工具,匯出只有語音的音軌,再放回你的剪輯。完全不用重拍。成品取決於分離得多乾淨,所以匯出前先播放語音軌,聽聽音樂有沒有從底下滲出來。

可以反過來只抽出背景音樂嗎?

可以。Perso Dubbing 會產生一條剝除所有人聲的純背景軌,以及第二個保留笑聲與掌聲、連同音樂的版本。兩者都是在乾淨鋪底上重新配音時常見的素材。

上傳影片,聽聽分離後的每一軌 →

要移除影片的背景音樂又保留說話聲,你得依照聲音的種類來分離音訊,而不是依照時間。把一段靜音,聲音會連人聲一起帶走。AI 音訊分離會把檔案拆成音樂軌和語音軌,讓你只匯出語音。

以上是簡短答案。至於你該用哪一種方法,其實只取決於一件事:原始音訊是否還以獨立音軌的形式存在。多數人都沒有,這也是為什麼這件事比看起來麻煩。

為什麼靜音行不通

直覺是找到有音樂的那段把它靜音。這行不通,原因很明確。

成片的音訊是一層混好的單一波形。音樂、你的聲音、房間的聲音,以及其他所有聲音,全都加總在同一條波形裡。底下並沒有一條音樂軌等著你去關掉。把一段靜音,那段裡的所有東西都會消失,包括你需要的那些話。

所以當音樂不間斷地鋪在說話聲底下時特別棘手,也就是咖啡廳拍攝、店內走動、健身房短片、研討會錄影這些情況。根本沒有可以下刀的空隙。

四種方法,以及各自適用的情況


方法

適用條件

成本

在剪輯軟體裡靜音音樂軌

原始專案裡音軌還是分開的

免費,但很少有

YouTube 工作室的歌曲工具

音樂造成了著作權主張

免費

Audacity 中央聲道技巧

檔案是真正的立體聲,音樂散在兩側

免費,但手機影片無效

AI 音訊分離

任何混好的檔案,包括單聲道手機影片

試用免費

方法一:在剪輯軟體裡靜音音樂軌

如果音樂是你自己在 Premiere、Final Cut、DaVinci Resolve 或剪映裡加上去的,而且專案檔還在,那就別往下讀了。打開專案,找到音樂軌,刪掉,匯出。

這是唯一零品質損失的方法,因為你不是從混音裡把東西剝出來,而是在混音發生之前就把那一層拿掉。

前提是音樂是後期加的,而且專案還在。如果音樂是拍攝當下就在現場,或你手上只有匯出的 MP4,請直接跳到方法四。

方法二:如果是因為著作權主張,先用 YouTube 工作室

如果你想拿掉音樂是因為 Content ID 主張,YouTube 工作室的編輯器裡就有內建的歌曲工具。它免費、不需要別的東西,先試它。

創作者指出的限制跟前面一樣:把被主張的片段靜音會連聲音一起帶走,而自動移除歌曲在說話聲密集鋪底的段落,不見得能穩定留下可用的音訊。YouTube 的工具一直在變,依賴它之前請先確認 YouTube 說明中心的最新指引。

如果結果不堪用,用方法四的檔案層級做法把對話拿回來,再換上已授權的音樂重新上傳就行。主張的處理流程我們在解決背景音樂著作權主張的指南裡談得更完整。

方法三:Audacity 中央聲道技巧,以及它為什麼常讓人失望

這是多數舊教學會教的方法,值得了解它為什麼會讓你失望。

Audacity 的人聲消除靠的是立體聲的空間位置,不是聲音辨識。在錄音室的音樂混音裡,主唱通常被擺在正中央,樂器散在左右。把其中一個聲道反相疊上去,中央的內容就互相抵消。

用在影片上有三個問題:

  • 它消掉的是相反的東西。 這個技巧抵消的是「置中」的內容。在影片裡,置中的是你的聲音,不是音樂。你會得到跟需求完全相反的結果。

  • 手機影片基本上是單聲道。 左右兩聲道幾乎是同一份音訊,沒有立體聲差異可以利用。這個技巧沒有東西可以運作,結果是一片安靜或根本沒變。

  • 真實空間不是錄音室混音。 從咖啡廳喇叭漏出來的音樂並沒有整齊地分到兩側,它到處都是,包括正中央。

搜尋數據也印證了這點:Audacity 式人聲消除的關注度年減幅度很大,而 AI 工具正在上升。這個方法在真正的立體聲音樂檔案上仍有它的位置,但對影片素材來說它不是對的工具。

方法四:AI 音訊分離

這是通用解,也是唯一能處理「音樂鋪在說話聲底下的單聲道 MP4」的方法。

它不靠立體聲位置,而是讓 AI 學會辨識不同種類的聲音長什麼樣子,再把它們拆成獨立音軌。語音成為一軌,背景音樂和環境音成為另一軌。接著你只匯出你要的。

Perso Dubbing

  1. 上傳影片檔。 不需要先抽出音訊。MP4、MOV、WebM 可直接處理,MP3、WAV、M4A 也一樣,單檔最大 200MB。

  2. 交給它分離。 檔案會拆成語音、個別說話者的聲音、背景音樂和環境音。

  3. 聽語音軌。 播放時專心聽音樂有沒有從底下滲出來。結果能不能用,就看這一步。

  4. 只匯出語音,帶回剪輯軟體,需要的話再加上已授權的音樂。

決定成品乾淨或混濁的,是分離品質。在這項任務的標準公開測試集 MUSDB18 上,Perso Dubbing 的 SI-SDR 中位數為 10.67 dB,勝過 Meta 的 HTDemucs(8.36 dB),在 50 首中贏了 44 首。每個樣本的結果都已公開,任何人都能自行重跑驗證。數據為 2026 年 5 月。

付費前可以用自己的檔案確認。前 60 秒不需註冊即可免費分離,試用檔案在工作階段結束後刪除。

用你自己的影片試試 →

你得到什麼,又失去什麼

多數教學會跳過這段,所以這裡直說。

當你匯出只有語音的音軌時,音樂沒了。房間也沒了。觀眾的笑聲、掌聲、街上的聲音、現場的殘響,全都和音樂待在同一個背景層,會跟著一起離開。

如果是咖啡廳放著音樂的談話類短片,這正是你要的:乾淨,音樂消失。

如果是活動側記、演講或脫口秀,只有語音的版本可能聽起來扁平,跟畫面對不上。兩種處理方式:

  • 在剪輯軟體裡把環境音補回去。 在對話底下鋪一層淡淡的室內底噪或觀眾聲,感覺就回來了。

  • 保留背景而不是語音。 Perso Dubbing 從一次上傳會產生兩種背景音軌。Background Music 給你剝除所有人聲後的純音樂與環境音;Background with Reaction 會把笑聲和掌聲連同音樂一起留下。當你要的是氛圍而不是話語時,用這兩軌。不過要注意,兩者都含音樂,所以當音樂本身就是問題時,它們都不是解方。

如果你只想調小聲,而不是拿掉

有時候音樂本身沒問題,只是在對話底下太大聲。

如果你有專案檔,這是音量自動化的工作:有人說話時把音樂軌壓低幾 dB 就好。每套剪輯軟體都有。

如果你只有成片,你沒辦法把一個不以圖層形式存在的東西調小。路徑一樣:先把音軌分離,再照你要的比例重新混。Perso Dubbing 可以把選定的音軌合併成單一檔案匯出,所以你能把語音搭配一條安靜下來的背景,而不是把它整個丟掉。

在 iPhone 上移除影片背景音樂

iOS 沒有內建功能能把成片裡的音樂和語音分開。照片 App 和 iMovie 可以把音訊靜音,但那又回到前面說的全有全無問題。

手機上實際可行的路是瀏覽器版的分離工具。從手機上傳影片,等分離完成,下載語音軌。什麼都不用裝。

順帶一提:把音訊整理乾淨

移除音樂常常只做了一半。如果錄音還有嘶聲、電流聲或房間回音,那是另一件事,叫降噪,而且要在分離之後對語音軌做,不是之前。近幾個月大家對整理影片音訊的關注度明顯上升,理由大概和分離一樣:工具終於能在真實素材上運作,而不是只能處理錄音室檔案。

順序很重要。先分離,再對分離出來的語音降噪。先對混好的檔案降噪,往往會把音樂糊進人聲裡,反而讓後面的分離變差。

常見問題

怎麼移除影片背景音樂又保留人聲?

依聲音種類分離音訊,然後只匯出語音軌。成片的音訊是一層混好的單一波形,而不是音樂和語音各自分開,所以靜音會把那個時間範圍裡的人聲一起消掉。AI 分離會把這層混音拆成獨立音軌,因此可以單獨保留語音。

可以免費移除影片背景音樂嗎?

一定程度上可以。如果你有原始專案檔,在剪輯軟體裡刪掉音樂軌是免費且零損失的。如果你只有匯出的檔案,Perso Dubbing 前 60 秒免費分離且不需註冊,足以判斷語音能不能乾淨地留下來。

為什麼移除背景音樂連觀眾的聲音也不見了?

因為笑聲、掌聲和現場殘響屬於背景層,不屬於語音層。只匯出語音時它們會全部一起消失。如果你需要現場感,可以在剪輯軟體裡補回室內底噪,或另外匯出背景軌,用比較低的音量混進去。

Audacity 的方法對影片有用嗎?

通常沒用。它抵消的是立體聲場中置中的內容,而影片裡置中的是人聲不是音樂;而且手機影片接近單聲道,沒有立體聲差異可以利用。它適合真正的立體聲音樂檔案,不適合拍攝素材。

不重拍要怎麼把影片的 BGM 拿掉?

把影片上傳到 AI 分離工具,匯出只有語音的音軌,再放回你的剪輯。完全不用重拍。成品取決於分離得多乾淨,所以匯出前先播放語音軌,聽聽音樂有沒有從底下滲出來。

可以反過來只抽出背景音樂嗎?

可以。Perso Dubbing 會產生一條剝除所有人聲的純背景軌,以及第二個保留笑聲與掌聲、連同音樂的版本。兩者都是在乾淨鋪底上重新配音時常見的素材。

上傳影片,聽聽分離後的每一軌 →

繼續閱讀

瀏覽全部

How to Evaluate AI Dubbing Quality Before You Buy
Product Guide

購買前如何評估 AI 配音品質

成長負責人及產品擁有者Untae Bae

Untae Bae

成長主管與產品擁有人

Can AI Dub and Translate Your Videos? What's Actually Possible in 2026
AI Strategy

AI 能為你的影片配音和翻譯嗎?2026 年實際上可以做到什麼

成長負責人及產品擁有者Untae Bae

Untae Bae

成長主管與產品擁有人

HeyGen AI配音評測 2026:功能、價格與結論
見解與趨勢

HeyGen AI配音評測 2026:功能、價格與結論

成長負責人及產品擁有者Untae Bae

Untae Bae

成長主管與產品擁有人