音源分離2分ガイド — DemucsとUVR Karaokeをローカルですぐ実行する

実測ベース比較 — インストール、実行、処理時間、出力ファイルまで実際に動かした結果

実際にローカルで動かした実測結果。macOS Apple Silicon(CPU)、Python 3.11環境。

Demucs — 2行で完了

インストール:

pip install demucs torchcodec

実行:

demucs song.mp3 --two-stems vocals

初回実行時にhtdemucsモデル(~80MB)を自動ダウンロード。

出力:

separated/htdemucs/song/
├── vocals.wav
└── no_vocals.wav

実測: 10秒音声→~10秒処理(CPU、Apple Silicon)。

UVR Karaoke — モデルは大きいが品質が違う

インストール:

pip install "audio-separator[cpu]"

実行:

audio-separator song.mp3 \
  --model_filename mel_band_roformer_karaoke_aufr33_viperx_sdr_10.1956.ckpt \
  --output_dir ./output

初回実行時に913MBモデルを自動ダウンロード(1〜5分)。

実測: 10秒音声→~43秒(モデルロード14秒+推論13秒+保存)。

比較表

Demucs UVR Karaoke
モデルサイズ ~80 MB 913 MB
処理時間(10秒、CPU) ~10秒 ~43秒
バッキングボーカル 除去される 伴奏に残る

結論

手軽に試す→Demucs。 シンプルなインストール、短いコマンド、小さいモデル。
カラオケ品質→UVR Karaoke。 大きくて遅いが、バッキングボーカルが伴奏に残り自然。

キーコンセプト

1

Demucsインストール:pip install demucs torchcodec

2

Demucs実行:demucs song.mp3 --two-stems vocals → vocals.wav + no_vocals.wav

3

UVRインストール:pip install "audio-separator[cpu]"

4

UVR実行:audio-separator song.mp3 --model_filename mel_band_roformer_karaoke_...ckpt

5

比較:Demucs(80MB、10秒)vs UVR(913MB、43秒)— 簡単なのはDemucs、カラオケ品質はUVR

ユースケース

カラオケ伴奏作成 — UVRでリードボーカルのみ除去(コーラス維持) MR作成 — Demucsでボーカル全体を除去 楽器練習 — Demucs 4ステムで特定パートのみ除去