🧬

オーディオAIの共通基盤技術 — Demucs、Mel-Band RoFormer、GPT-SoVITSが共有するもの

STFTスペクトログラム、Transformerアテンション、エンコーダー・デコーダー、PyTorch — オーディオAIの共通DNA

Demucs、Mel-Band RoFormer Karaoke、GPT-SoVITSを分析して共通パターンが見えた。目的は違うが骨格が同じ。

共通点1:STFT — 音を絵に変える

STFT(短時間フーリエ変換)はオーディオ波形を時間×周波数の2D行列に変換する。オーディオAIの出発点。

spec = torch.stft(wav, n_fft=2048, hop_length=441, return_complex=True)

3モデル全部この変換を通る。

共通点2:Transformer — 遠距離の関係を捉える

3モデル全部Self-Attentionを核心に置く。CNNの受容野はカーネルサイズに制限される。オーディオでは数秒前のリズムパターン、基本周波数の倍音、30秒後のコーラス繰り返しなど長距離依存性が必要。

共通点3:エンコーダー・デコーダー — 分解して復元

3モデル全部、入力を圧縮(エンコード)→処理→元の形に復元(デコード)する構造。

共通点4:PyTorch + GPU + 事前学習モデル

全部PyTorch実装、CUDA/MPS GPU加速、HuggingFace/GitHubから事前学習チェックポイントダウンロード。pip install+モデルダウンロード+3行コードで実行可能。

共通点5:オーディオの「分解」

方向は違うが本質は同じ — 複雑なオーディオ信号を意味のある構成要素に分解する。

共通点6:マスキング vs 生成

分離モデルはマスキング(原本×マスク=分離ソース)、合成モデルは生成(新しいオーディオトークンを作る)。だが両方とも周波数ドメインで作業する。

なぜ重要か

4つの質問で大部分のオーディオAIモデルを分類できる:
1. 入力表現は?(STFT?メル?raw?)
2. アテンションはどこに?(時間軸?周波数軸?両方?)
3. エンコーダー・デコーダー構造か?
4. マスキングか生成か?

キーコンセプト

1

STFTでオーディオ波形を時間×周波数スペクトログラムに変換 — オーディオAIの出発点

2

Transformer Self-Attentionで長距離の時間・周波数依存性を捕捉

3

エンコーダー・デコーダーで高次元入力を潜在空間に圧縮→処理→復元

4

分離モデルはマスキング(原本×マスク)、合成モデルは生成(新トークン出力)

ユースケース

新しいオーディオAIモデル理解 — STFT/Transformer/エンコーダー・デコーダー/マスキングの4つで分類 オーディオAIパイプライン設計 — 共通基盤の上に目的別構成要素を選択 モデル性能比較 — 同じ基盤上でアーキテクチャの違いが生む品質差を理解