曲からボーカルを削除する方法。Twitch配信向けの3つのツール完全ガイド
要約
曲からボーカルを削除するなら、AIステムセパレーションが現実的。LALAL.AI(クラウド、10ステム)、HTDemucs(ローカル、無料)、Moises(理論解析付き)の3つが2026年現在での実用的選択肢。配信用ならSunoなどの生成ツールが法的に安全。
曲からボーカルを削除する方法は、AIステムセパレーションが現在最速だ。トラックをアップロード、ボーカルステムを選択、インスト版を60秒でダウンロード。ブラウザベース、DAW不要。このガイドでは、実用的な選択肢3つと、それぞれの落とし穴を実装レベルで解説する。
SoundCloudで見つけたネタを使いたい。配信用のインスト版が必要。プロデューサーからファイルをもらえない。リミックスしたいけど、A&Rから返事がない。何が使える、いくらかかる、どこで失敗するのか。ここまでが現実。
ステムセパレーションが実際にやっていること
ステムセパレーションはボーカルトラックを消すわけではない。音声信号の特性を学習して、ボーカルなしで残りの信号を再構成する。
古い手法はフェーズキャンセレーション。ボーカルがステレオ中央にある場合、片チャンネルを反転して単調にまとめればセンター成分が打ち消される。1970年代のモノ録音なら動く。リバーブ、ステレオ幅、サイドチェーン圧縮が入ってると失敗する。つまり1985年以降のすべてだ。
AIベースの分離は違う。LALAL.AIのPerseus、Meta開発のオープンソースHTDemucsのような古典的ニューラルネットワークは、数百万本の分離済みトラックで学習してる。パン位置に関わらず、ボーカルの音響特性を独立して認識する。Perseusは今2026年、10ステム分離に対応。ボーカルだけじゃなく、ボーカル主旋律とバッキング、キック、スネア、ベース、ギター、ピアノ、シンセ、ストリングス、エフェクト。マスター音源から完全なマルチトラックを引き出す。
現実的な出力は60~80%クリーン。ボーカルがめっぽう重いリバーブ処理されたポップスはアーティファクトが残る。サビは常にメロより汚い。物理的事実であって、バグではない。
2026年現在、使う価値がある3つのツール
選択肢は限られてる。ゼロセットアップのクラウドから最高品質のローカル処理まで、この3つがすべて。
LALAL.AI が最速クラウドオプション。WAVかFLACをアップロード、ボーカルターゲット指定、最初の30秒をプレビュー。無料枠は月単位の制限。有料は15ドル/月から。Perseusモデルは2026年初頭に10ステム対応になった。単なるボーカルリムーバーじゃなくなってる。
Moises はほぼ同等のクラウド品質だが、コード検出、キー解析、テンポマップが付く。年額$4/月(4ドル)でLALAL.AIを下回る。音楽理論レイヤーがあるメリットは、ネタを学習するなら重要。サンプル用にステム取るだけなら不要。
Ultimate Vocal Remover(UVR5) は無料、オープンソース、ローカル実行。HTDemucsアンサンブルモードはエンタープライズグレード以外のツールでいちばん透明度が高い。トレードオフはGPUが要ること、トラックあたり10~15分。ファイルサイズ制限なし、サブスク無し、クレジット無し。ハードウェアと時間があるなら、これが天井。
iZotope RX 12 Music Rebalanceはポストプロダクション標準で199~1,199ドル。オーディオ修復作業に持ってるなら使え。持ってなけりゃUVR5が無料で同等かそれ以上。

LALAL.AIでステップバイステップ
音声ファイルをドラッグドロップ。ボーカルをセパレーション対象に指定。プレビュー押す。最初の30秒が処理されて、フル実行前に結果が聞ける。
いちばん結果が変わる設定がDe-Echo。デフォルトはオフ。ボーカルに大量のリバーブやディレイが焼き込まれてるなら有効にしろ。モダンなヒップホップ、ポップ、R&Bなら、99%のケースで尾部ブリードがマシになる。
WAVで、元のサンプリングレートでエクスポート。用途に指定されてない限りMP3にダウンサンプルするな。圧縮アーティファクトが処理を通して累積する。
所要時間は普通1~3分/トラック、クラウドツール。無料枠はピーク時間が遅い。
UVR5なら、GitHubからアプリケーションダウンロード、Demucsモデルをインストール、アンサンブルモード選択(複数パス実行して平均化)、出力をWAVに設定。処理時間はGPU依存。RTX 3070なら3分トラックで約8分。CPU onlyで30~45分。
著作権の話、誰もが避けたい部分
ステムを分離した。インスト版を手に入れた。次は何か。
TwitchやKickの配信背景に使う場合、元の曲の著作権はインスト版も含めてカバーされる。処理しても権利移譲はない。YouTubeから音声を抜くのと同じ法的立場。レーベルはAI分離されたステム配布を2025年から積極的に追求してる。プラットフォームはオリジナル処理不問の音声フィンガープリント検出をして、処理されたステムもスキャンしてる。
プライベート用途なら(カラオケ練習、リミックス作業、DAWでの学習)、リスク低い。ゼロではない。でも個人のAbleton Projectが永遠に外に出ないならハンターはいない。
ストリーム配信、公開投稿、サンプリング、商用リリースなら、ライセンスか新規生成。これは細部じゃなく、事実。
DMCAセーフなインストをストリームで流したいなら、ゼロから構築しろ。
配信者にはなぜ生成が除去より優れてるか
ユースケースが「配信用のテクノベッドで、DMCA対策済み」なら、著作曲からボーカルを除去するのは遠回りで危ない。
Sunoはボーカルなしモードで完全トラックを10秒以下で生成。スタイルプロンプト動作は手がかり値:「暗いミニマル テクノ 128 BPM、ボーカルなし、シンセベース、キックとハンドクラップ、ロングリバーブテール」。ストリーム安全、DMCA露出ゼロ。他のストリーマーが使ってないトラック。
Stable Audioはループ生成がトラック作成より得意。ターゲット長を指定(8小節、16小節)、プロンプト入力。複数バリエーション出力してライブDJセットでレイヤー。デフォルト-14 LUFS出力、Twitchの音圧正規化に合わせてある。プラットフォームオーディオ処理と戦わない。
セパレーションワークフローは、特定のプロダクションが必要で、参照・リミックス・分析したい時に意味がある。ストリーミング用ライブラリ構築の第一選択肢ではない。生成がこの速度、この法的免除度レベルな場合は特に。
ぶつかるアーティファクトと対処法
水っぽい「水中」インスト: ニューラルネットワークモデルを変える。LALAL.AIもUVR5も複数オプション用意。最初の30秒を各モデルで実行。キャラが大きく変わる、ソース素材による。
サビでボーカルブリード: 主旋律と密集した楽器がおなじ周波数帯占有するなら予想通り。De-Echoを有効にして再実行。ブリードが残るなら、セパレーションを下地にして、シンセやサンプルをトップに乗せる。グルーヴが完全な沈黙より大事。
中低域が空洞化: ベース楽器とボーカル基本周波数が重複してるケース多し(150~400Hz帯)。分離後にEQで平坦化しようとするな。ブリードが上がる。マルチバンドコンプレッサーをそのレンジ投入して出力後に圧縮かけろ。アーティファクト拡大なしにボディ復帰。
圧縮ソースからの品質低下: 128kbps MP3入力はWAVより分離が汚い。モデルが情報不足で開始してる。出力が重要なら、より高品質なソース追跡。Spotifyの最高品質は320kbps OGG。圧縮済。クリーンで必要なら、オリジナルWAVか、Bandcampで買う。

DAWワークフロー内で実行
インストを手に入れたら、DAWで元テンポで読み込む。LALAL.AIとMoisesはメタデータで検出BPM返す。ステムツールからのテンポでプロジェクトテンポ設定してからインポート。
Ableton:WAVを新規オーディオトラックにドラッグ、右クリック「Warp」選択。複雑なドラムパターン持つトラックならComplex Proアルゴリズム。マスターBPMをツール検出テンポに合わせ。
FL Studio:チャンネルラックスロット右クリック、「Stretch to tempo」選択。同じ原理。
ステムファイルはボーカルがあった場所でゼロサンプルを持つ。沈黙ギャップ。欠落データではない。DAWが正確にレンダリング。指示がなけりゃ埋めるな。
ループ抽出用:ドロップかメロディ部だけ欲しいなら、インポート後DAW内で切分け。プロジェクトサンプリングレートでそのループを他セッションと互換性最大でエクスポート。
本当のテスト:140 BPMのテクノセットで投げ込んで、キック圧縮の奥でアーティファクト聞こえるか。大抵、聞こえない。
どのフォーマットが最高品質の分離をくれるか
ツール選択より入力品質が多くのトラックで重要。ソース素材のランキング、ベストから最悪:
WAV/AIFFオリジナルセッションレート(44.1kHzか48kHz):セパレーションモデルが学習する素材、最クリーン出力
FLAC:ロスレス圧縮、WAVと同一結果
320kbps MP3かOGG:軽微な品質低下、大抵合格
128kbps MP3:著しく劣化、複雑なポリフォニックセクション特に
ストリーミングからソースするなら、プラットフォームが提供する最高品質ダウンロードオプション使え。TidalはHiFiティアでロスレスFLACダウンロード提供。Bandcampは多くのインディプロデューサーからWAVマスター直売り。
補足:ステレオファイルはモノより分離いい。ボーカルバスにステレオ幅があるなら、AIモデルがその空間情報使う。モノコラプスは分離品質を傷める。
モノ録音からボーカル除去しようとしたら、ステレオ同一トラックより汚く聞こえる。幾つかで小さい差分、他では大きい。