
製品ガイド
動画のBGMだけを消して声を残す方法

AIビデオ翻訳、ローカリゼーション、および吹き替えツール
無料でお試しください
動画からBGMだけを外して話し声を残すには、時間ではなく音の種類で音声を分ける必要があります。区間をミュートすれば声まで一緒に消えます。AIによる音声分離はファイルを音楽トラックと話し声トラックに割るので、話し声だけを選んで書き出せます。
ここまでが短い答えです。どの方法を使うべきかは、たった一つで決まります。元の音声がまだ別々のトラックとして残っているかどうかです。多くの場合は残っておらず、だからこの問題は見た目より厄介です。

ミュートが通用しない理由
問題の区間を見つけてミュートすれば済みそうに思えます。ところが済みません。理由ははっきりしています。
完成した動画の音声は、一つに混ざった単一のレイヤーです。音楽も声も部屋の音も、それ以外のすべても、一本の波形に足し合わされています。下に音楽チャンネルが隠れていて、切ってくれるのを待っているわけではありません。区間をミュートすればその中のすべてが消え、そこには必要だった言葉も入っています。
だから音楽が話し声の下に途切れず敷かれているときにとりわけ厄介です。カフェでの撮影、店舗のウォークスルー、ジムのクリップ、カンファレンスの録画がまさにそれです。カットする隙間そのものがありません。
四つの方法と、それぞれが通用する場面
方法 | 通用する条件 | コスト |
|---|---|---|
編集ソフトで音楽トラックをミュート | 元のプロジェクトにトラックが別々に残っているとき | 無料。ただし稀 |
YouTube Studioの楽曲ツール | その音楽が原因で申し立てが付いたとき | 無料 |
Audacityのセンターチャンネル技 | 本物のステレオで、音楽が広がっているとき | 無料。スマホ映像では失敗 |
AI音声分離 | モノラルのスマホ映像を含む、あらゆるミックス済みファイル | 確認は無料 |
方法1: 編集ソフトで音楽トラックをミュート
Premiere、Final Cut、DaVinci Resolve、CapCutで自分で音楽を載せ、プロジェクトファイルがまだ手元にあるなら、ここで読むのをやめてください。プロジェクトを開き、音楽トラックを探して削除し、書き出せば終わりです。
品質の劣化がまったくない唯一の方法です。ミックスから何かを引き剥がすのではなく、混ざる前にレイヤーを外しているからです。
ただし音楽を後から足していて、プロジェクトが残っていることが条件です。撮影現場に音楽があった場合や、書き出したMP4しかない場合は方法4へ進んでください。
方法2: 申し立てが理由ならYouTube Studio
音楽を消したい理由がContent IDの申し立てなら、YouTube Studioのエディタに楽曲ツールが組み込まれています。無料で他に何も要らないので、まず試してください。
クリエイターが指摘する限界は先ほどと同じです。申し立て区間をミュートすると声も一緒に消え、自動の楽曲削除は話し声が密に敷かれた区間で使える音声を安定して残せません。YouTubeのツールは変わり続けるので、頼る前にYouTubeヘルプの最新の案内をご確認ください。
結果が使えない水準なら、方法4のファイル単位のやり方で台詞を取り戻し、ライセンス済みの楽曲に差し替えて再アップロードすれば済みます。申し立ての手続き自体はBGMの著作権の申し立てを解決するガイドで詳しく扱っています。
方法3: Audacityのセンターチャンネル技と、その限界
古いチュートリアルのほとんどが勧める方法です。なぜがっかりすることになるのか、知っておく価値があります。
Audacityのボーカル除去は、音を認識するのではなくステレオの位置を利用します。スタジオの音楽ミックスでは、メインボーカルが真ん中に置かれ、楽器が左右に広がります。片方のチャンネルを反転させて重ねると、真ん中にあるものが打ち消されます。
動画に使おうとすると問題が三つあります。
消したい対象が逆です。 この技は真ん中にあるものを消します。動画で真ん中にあるのは音楽ではなく自分の声です。望んだのと正反対の結果になります。
スマホ映像は事実上モノラルです。 左右のチャンネルがほぼ同じ音を持っていて、利用できるステレオの差がありません。技が働く材料そのものがなく、無音になるか何も変わりません。
実際の空間はスタジオミックスではありません。 カフェのスピーカーから漏れた音楽は、左右にきれいに分かれていません。真ん中を含めて、そこら中にあります。
検索データも同じことを語っています。Audacityベースのボーカル除去への関心は前年から大きく落ち、AIベースのツールは伸びています。本物のステレオ音楽ファイルには今も出番があります。映像素材には合う道具ではありません。
方法4: AI音声分離
一般的な正解であり、話し声の下に音楽が敷かれたモノラルのMP4で通用する唯一の方法です。
ステレオの位置を使う代わりに、AIが音の種類ごとの形を学習して、別々のトラックに引き剥がします。話し声が一つのトラックになり、BGMと環境音が別のトラックになります。あとは欲しいものだけを書き出すだけです。
Perso Dubbingでの手順です。
動画ファイルをアップロードします。 音声を先に抽出する必要はありません。MP4、MOV、WebMはもちろん、MP3、WAV、M4Aまで200MBまでそのまま扱えます。
分離を任せます。 ファイルが話し声、話者ごとの声、BGM、環境音に分かれます。
話し声トラックを聴きます。 再生しながら、音楽が下から漏れていないかに集中します。使える結果かどうかがここで決まります。
話し声だけを書き出し、編集ソフトに持ち帰って、必要ならライセンス済みの音楽を載せます。
きれいな結果と濁った結果を分けるのは分離の品質です。この作業の標準的な公開ベンチマークであるMUSDB18で、Perso Dubbingは中央値SI-SDR 10.67 dBを記録し、MetaのHTDemucs(8.36 dB)を上回りました。50トラック中44トラックで勝っています。サンプルごとの結果が公開されているので、誰でも自分で検証し直せます。2026年5月時点の数値です。
支払う前に自分のファイルで確かめられます。最初の60秒は登録なしで無料で分離され、体験用のファイルはセッション終了時に削除されます。
得るものと失うもの
多くのチュートリアルが飛ばす部分なので、はっきり書いておきます。
話し声だけを残して書き出すと、音楽が消えます。そして空間も一緒に消えます。観客の笑い、拍手、街の音、現場の響きがすべて音楽と同じ背景レイヤーにあるので、一緒に抜けていきます。
カフェの音楽が敷かれたトーキングヘッドのクリップなら、これがまさに望んだ結果です。きれいになって音楽は消えます。
イベントレポートや講演、コメディのステージなら、話し声だけの結果が画面から浮いて、平板に聞こえることがあります。やり方は二つです。
編集ソフトで空気感を戻します。 台詞の下に薄いルームトーンや観客音を敷けば、感じが戻ります。
話し声ではなく背景を残します。 Perso Dubbingは一度のアップロードで背景トラックを二種類つくります。
Background Musicは人の音をすべて取り除いた純粋な音楽と環境音を、Background with Reactionは笑いと拍手を音楽と一緒に残します。言葉ではなく雰囲気が要るときに使うトラックです。ただしどちらも音楽を含むので、音楽そのものが問題のときに切るカードではありません。
消すのではなく下げたいなら
音楽が問題なのではなく、ただ台詞の下で大きすぎるだけのこともあります。
プロジェクトファイルがあるなら、これはボリュームオートメーションの作業です。誰かが話すたびに音楽トラックを数dB下げれば済みます。どの編集ソフトにもある機能です。
完成したファイルしかないなら、レイヤーとして存在しないものを下げることはできません。道は同じです。トラックを分離してから、望むバランスで混ぜ直します。Perso Dubbingは選んだトラックを一つにまとめて書き出せるので、音楽を完全に外す代わりに、話し声と静かになった背景を組み合わせられます。
iPhoneで動画のBGMを消す
完成した動画から音楽と話し声を分離してくれるiOSの標準機能はありません。写真アプリやiMovieは音声をミュートできますが、結局さきほどの全か無かの問題に戻ります。
スマホでの現実的な道は、ブラウザベースの分離ツールです。スマホから動画をアップロードし、分離が終わったら話し声トラックをダウンロードします。インストールするものはありません。
ついでに: 音声の整理
音楽の除去は半分であることが多いです。録音にノイズやハム、部屋の反響まであるなら、それはノイズリダクションという別の作業で、分離の前ではなく後に話し声トラックへかけます。動画音声の整理への関心はここ数か月で急に伸びました。分離と同じ理由でしょう。ツールがようやくスタジオのファイルではなく実際の撮影素材で動くようになったからです。
順番が大事です。まず分離し、それから分離された話し声にノイズリダクションをかけます。混ざったファイルに先にノイズリダクションをかけると、音楽が声のほうへにじんで、あとの分離がかえって悪くなります。
よくある質問
動画からBGMだけを外して声を残すには?
音の種類で音声を分離し、話し声トラックだけを書き出します。完成した動画の音声は音楽と話し声が別々にあるのではなく一つに混ざったレイヤーなので、ミュートするとその時間範囲の声まで一緒に消えます。AI分離はこのミックスを独立したトラックに割るため、話し声だけを残せます。
動画のBGMを無料で消せますか?
ある程度は可能です。元のプロジェクトファイルがあるなら、編集ソフトで音楽トラックを削除するのは無料で品質の劣化もありません。書き出したファイルしかない場合は、Perso Dubbingが最初の60秒を登録なしで無料で分離してくれるので、話し声がきれいに生き残るか判断するには十分です。
BGMを消すとなぜ観客の音まで消えるのですか?
笑い声、拍手、現場の響きが話し声のレイヤーではなく背景のレイヤーに属しているからです。話し声だけを書き出すとすべて一緒に抜けます。空気感が要るなら、編集ソフトでルームトーンを戻すか、背景トラックを別に書き出して低いレベルで混ぜてください。
Audacityの方法は動画にも通用しますか?
たいてい通用しません。ステレオで真ん中にある音を打ち消す方式ですが、動画で真ん中にあるのは音楽ではなく声です。しかもスマホ映像はモノラルに近く、利用できるステレオの差がありません。本物のステレオ音楽ファイル向けの方法であって、撮影素材向けではありません。
撮り直さずに動画のBGMを消すには?
動画をAI分離ツールにアップロードし、話し声だけのトラックを書き出して編集に戻します。撮り直す必要はありません。結果は分離のきれいさ次第なので、書き出す前に話し声トラックを聴いて、音楽が下から漏れていないか確認してください。
逆にBGMだけを抽出できますか?
できます。Perso Dubbingは人の音をすべて取り除いた純粋な背景トラックと、笑いと拍手を音楽と一緒に残した二つ目のバージョンをつくります。どちらもきれいなベッドの上に新しくダビングするときによく使われる素材です。
動画からBGMだけを外して話し声を残すには、時間ではなく音の種類で音声を分ける必要があります。区間をミュートすれば声まで一緒に消えます。AIによる音声分離はファイルを音楽トラックと話し声トラックに割るので、話し声だけを選んで書き出せます。
ここまでが短い答えです。どの方法を使うべきかは、たった一つで決まります。元の音声がまだ別々のトラックとして残っているかどうかです。多くの場合は残っておらず、だからこの問題は見た目より厄介です。

ミュートが通用しない理由
問題の区間を見つけてミュートすれば済みそうに思えます。ところが済みません。理由ははっきりしています。
完成した動画の音声は、一つに混ざった単一のレイヤーです。音楽も声も部屋の音も、それ以外のすべても、一本の波形に足し合わされています。下に音楽チャンネルが隠れていて、切ってくれるのを待っているわけではありません。区間をミュートすればその中のすべてが消え、そこには必要だった言葉も入っています。
だから音楽が話し声の下に途切れず敷かれているときにとりわけ厄介です。カフェでの撮影、店舗のウォークスルー、ジムのクリップ、カンファレンスの録画がまさにそれです。カットする隙間そのものがありません。
四つの方法と、それぞれが通用する場面
方法 | 通用する条件 | コスト |
|---|---|---|
編集ソフトで音楽トラックをミュート | 元のプロジェクトにトラックが別々に残っているとき | 無料。ただし稀 |
YouTube Studioの楽曲ツール | その音楽が原因で申し立てが付いたとき | 無料 |
Audacityのセンターチャンネル技 | 本物のステレオで、音楽が広がっているとき | 無料。スマホ映像では失敗 |
AI音声分離 | モノラルのスマホ映像を含む、あらゆるミックス済みファイル | 確認は無料 |
方法1: 編集ソフトで音楽トラックをミュート
Premiere、Final Cut、DaVinci Resolve、CapCutで自分で音楽を載せ、プロジェクトファイルがまだ手元にあるなら、ここで読むのをやめてください。プロジェクトを開き、音楽トラックを探して削除し、書き出せば終わりです。
品質の劣化がまったくない唯一の方法です。ミックスから何かを引き剥がすのではなく、混ざる前にレイヤーを外しているからです。
ただし音楽を後から足していて、プロジェクトが残っていることが条件です。撮影現場に音楽があった場合や、書き出したMP4しかない場合は方法4へ進んでください。
方法2: 申し立てが理由ならYouTube Studio
音楽を消したい理由がContent IDの申し立てなら、YouTube Studioのエディタに楽曲ツールが組み込まれています。無料で他に何も要らないので、まず試してください。
クリエイターが指摘する限界は先ほどと同じです。申し立て区間をミュートすると声も一緒に消え、自動の楽曲削除は話し声が密に敷かれた区間で使える音声を安定して残せません。YouTubeのツールは変わり続けるので、頼る前にYouTubeヘルプの最新の案内をご確認ください。
結果が使えない水準なら、方法4のファイル単位のやり方で台詞を取り戻し、ライセンス済みの楽曲に差し替えて再アップロードすれば済みます。申し立ての手続き自体はBGMの著作権の申し立てを解決するガイドで詳しく扱っています。
方法3: Audacityのセンターチャンネル技と、その限界
古いチュートリアルのほとんどが勧める方法です。なぜがっかりすることになるのか、知っておく価値があります。
Audacityのボーカル除去は、音を認識するのではなくステレオの位置を利用します。スタジオの音楽ミックスでは、メインボーカルが真ん中に置かれ、楽器が左右に広がります。片方のチャンネルを反転させて重ねると、真ん中にあるものが打ち消されます。
動画に使おうとすると問題が三つあります。
消したい対象が逆です。 この技は真ん中にあるものを消します。動画で真ん中にあるのは音楽ではなく自分の声です。望んだのと正反対の結果になります。
スマホ映像は事実上モノラルです。 左右のチャンネルがほぼ同じ音を持っていて、利用できるステレオの差がありません。技が働く材料そのものがなく、無音になるか何も変わりません。
実際の空間はスタジオミックスではありません。 カフェのスピーカーから漏れた音楽は、左右にきれいに分かれていません。真ん中を含めて、そこら中にあります。
検索データも同じことを語っています。Audacityベースのボーカル除去への関心は前年から大きく落ち、AIベースのツールは伸びています。本物のステレオ音楽ファイルには今も出番があります。映像素材には合う道具ではありません。
方法4: AI音声分離
一般的な正解であり、話し声の下に音楽が敷かれたモノラルのMP4で通用する唯一の方法です。
ステレオの位置を使う代わりに、AIが音の種類ごとの形を学習して、別々のトラックに引き剥がします。話し声が一つのトラックになり、BGMと環境音が別のトラックになります。あとは欲しいものだけを書き出すだけです。
Perso Dubbingでの手順です。
動画ファイルをアップロードします。 音声を先に抽出する必要はありません。MP4、MOV、WebMはもちろん、MP3、WAV、M4Aまで200MBまでそのまま扱えます。
分離を任せます。 ファイルが話し声、話者ごとの声、BGM、環境音に分かれます。
話し声トラックを聴きます。 再生しながら、音楽が下から漏れていないかに集中します。使える結果かどうかがここで決まります。
話し声だけを書き出し、編集ソフトに持ち帰って、必要ならライセンス済みの音楽を載せます。
きれいな結果と濁った結果を分けるのは分離の品質です。この作業の標準的な公開ベンチマークであるMUSDB18で、Perso Dubbingは中央値SI-SDR 10.67 dBを記録し、MetaのHTDemucs(8.36 dB)を上回りました。50トラック中44トラックで勝っています。サンプルごとの結果が公開されているので、誰でも自分で検証し直せます。2026年5月時点の数値です。
支払う前に自分のファイルで確かめられます。最初の60秒は登録なしで無料で分離され、体験用のファイルはセッション終了時に削除されます。
得るものと失うもの
多くのチュートリアルが飛ばす部分なので、はっきり書いておきます。
話し声だけを残して書き出すと、音楽が消えます。そして空間も一緒に消えます。観客の笑い、拍手、街の音、現場の響きがすべて音楽と同じ背景レイヤーにあるので、一緒に抜けていきます。
カフェの音楽が敷かれたトーキングヘッドのクリップなら、これがまさに望んだ結果です。きれいになって音楽は消えます。
イベントレポートや講演、コメディのステージなら、話し声だけの結果が画面から浮いて、平板に聞こえることがあります。やり方は二つです。
編集ソフトで空気感を戻します。 台詞の下に薄いルームトーンや観客音を敷けば、感じが戻ります。
話し声ではなく背景を残します。 Perso Dubbingは一度のアップロードで背景トラックを二種類つくります。
Background Musicは人の音をすべて取り除いた純粋な音楽と環境音を、Background with Reactionは笑いと拍手を音楽と一緒に残します。言葉ではなく雰囲気が要るときに使うトラックです。ただしどちらも音楽を含むので、音楽そのものが問題のときに切るカードではありません。
消すのではなく下げたいなら
音楽が問題なのではなく、ただ台詞の下で大きすぎるだけのこともあります。
プロジェクトファイルがあるなら、これはボリュームオートメーションの作業です。誰かが話すたびに音楽トラックを数dB下げれば済みます。どの編集ソフトにもある機能です。
完成したファイルしかないなら、レイヤーとして存在しないものを下げることはできません。道は同じです。トラックを分離してから、望むバランスで混ぜ直します。Perso Dubbingは選んだトラックを一つにまとめて書き出せるので、音楽を完全に外す代わりに、話し声と静かになった背景を組み合わせられます。
iPhoneで動画のBGMを消す
完成した動画から音楽と話し声を分離してくれるiOSの標準機能はありません。写真アプリやiMovieは音声をミュートできますが、結局さきほどの全か無かの問題に戻ります。
スマホでの現実的な道は、ブラウザベースの分離ツールです。スマホから動画をアップロードし、分離が終わったら話し声トラックをダウンロードします。インストールするものはありません。
ついでに: 音声の整理
音楽の除去は半分であることが多いです。録音にノイズやハム、部屋の反響まであるなら、それはノイズリダクションという別の作業で、分離の前ではなく後に話し声トラックへかけます。動画音声の整理への関心はここ数か月で急に伸びました。分離と同じ理由でしょう。ツールがようやくスタジオのファイルではなく実際の撮影素材で動くようになったからです。
順番が大事です。まず分離し、それから分離された話し声にノイズリダクションをかけます。混ざったファイルに先にノイズリダクションをかけると、音楽が声のほうへにじんで、あとの分離がかえって悪くなります。
よくある質問
動画からBGMだけを外して声を残すには?
音の種類で音声を分離し、話し声トラックだけを書き出します。完成した動画の音声は音楽と話し声が別々にあるのではなく一つに混ざったレイヤーなので、ミュートするとその時間範囲の声まで一緒に消えます。AI分離はこのミックスを独立したトラックに割るため、話し声だけを残せます。
動画のBGMを無料で消せますか?
ある程度は可能です。元のプロジェクトファイルがあるなら、編集ソフトで音楽トラックを削除するのは無料で品質の劣化もありません。書き出したファイルしかない場合は、Perso Dubbingが最初の60秒を登録なしで無料で分離してくれるので、話し声がきれいに生き残るか判断するには十分です。
BGMを消すとなぜ観客の音まで消えるのですか?
笑い声、拍手、現場の響きが話し声のレイヤーではなく背景のレイヤーに属しているからです。話し声だけを書き出すとすべて一緒に抜けます。空気感が要るなら、編集ソフトでルームトーンを戻すか、背景トラックを別に書き出して低いレベルで混ぜてください。
Audacityの方法は動画にも通用しますか?
たいてい通用しません。ステレオで真ん中にある音を打ち消す方式ですが、動画で真ん中にあるのは音楽ではなく声です。しかもスマホ映像はモノラルに近く、利用できるステレオの差がありません。本物のステレオ音楽ファイル向けの方法であって、撮影素材向けではありません。
撮り直さずに動画のBGMを消すには?
動画をAI分離ツールにアップロードし、話し声だけのトラックを書き出して編集に戻します。撮り直す必要はありません。結果は分離のきれいさ次第なので、書き出す前に話し声トラックを聴いて、音楽が下から漏れていないか確認してください。
逆にBGMだけを抽出できますか?
できます。Perso Dubbingは人の音をすべて取り除いた純粋な背景トラックと、笑いと拍手を音楽と一緒に残した二つ目のバージョンをつくります。どちらもきれいなベッドの上に新しくダビングするときによく使われる素材です。
続きを読む
すべてを閲覧する
開発者
API
エンタープライズ
ソリューション
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618
開発者
API
エンタープライズ
ソリューション
ESTsoft Inc. 15770 Laguna Canyon Rd #250, Irvine, CA 92618





