🏢

Mixture of Experts(MoE)

必要な専門家のみ活性化して効率的スケーリング

Mixture of Experts(MoE)はモデルのパラメータ数と実際の計算量を分離するアーキテクチャです。従来のDenseモデルは全入力に全パラメータを使用しますが、MoEはルーター(Router/Gate)が各トークンごとに上位k個の専門家のみ選択して活性化します。例えばMixtral 8x7Bは総47Bパラメータですが、各トークンあたり2つのExpertのみ活性化して実際の計算は13Bモデル水準です。GPT-4もMoEアーキテクチャと言われています。大きなモデルの品質を維持しながら推論コストを削減する核心技術です。

キーコンセプト

1

入力トークンがルーター(Gate Network)に伝達

2

ルーターが各Expertに対する確率(重み)を計算

3

上位k個のExpertのみ選択(通常k=2)

4

選択されたExpertがそれぞれ独立に入力を処理

5

Expert出力をルーター重みで加重平均して最終出力を生成

6

Load Balancing Lossで特定Expertにトークンが集中しないよう制御

メリット

  • 同じ計算量でより高い性能(Dense比)
  • パラメータスケーリングが容易
  • 各Expertが自然に専門化
  • 推論コスト効率的

デメリット

  • メモリ使用量は全パラメータ基準(大きい)
  • Expert間の負荷不均衡問題
  • 学習の不安定さ(ルーター学習の困難さ)
  • 分散学習時の通信オーバーヘッド

ユースケース

Mixtral 8x7B / 8x22B(Mistral AI) GPT-4(推定) Switch Transformer(Google) Grok(xAI) DeepSeek-V2(DeepSeek)