🏢

Mixture of Experts (MoE)

필요한 전문가만 활성화하여 효율적 스케일링

Mixture of Experts(MoE)는 모델 파라미터 수와 실제 연산량을 분리하는 아키텍처입니다. 기존 Dense 모델은 모든 입력에 모든 파라미터를 사용하지만, MoE는 라우터(Router/Gate)가 각 토큰마다 상위 k개의 전문가만 선택하여 활성화합니다. 예를 들어 Mixtral 8x7B는 총 47B 파라미터이지만, 각 토큰당 2개의 Expert만 활성화하여 실제 연산은 13B 모델 수준입니다. GPT-4도 MoE 아키텍처로 알려져 있습니다. 큰 모델의 품질을 유지하면서 추론 비용을 줄이는 핵심 기술입니다.

핵심 개념

1

입력 토큰이 라우터(Gate Network)에 전달

2

라우터가 각 Expert에 대한 확률(가중치)을 계산

3

상위 k개 Expert만 선택 (보통 k=2)

4

선택된 Expert들이 각각 독립적으로 입력 처리

5

Expert 출력을 라우터 가중치로 가중 평균하여 최종 출력 생성

6

Load Balancing Loss로 특정 Expert에 토큰이 몰리지 않도록 제어

장점

  • 같은 연산량으로 더 높은 성능 (Dense 대비)
  • 파라미터 스케일링이 용이
  • 각 Expert가 자연스럽게 전문화
  • 추론 비용 효율적

단점

  • 메모리 사용량은 전체 파라미터 기준 (큼)
  • Expert 간 부하 불균형 문제
  • 학습 불안정 (라우터 학습 어려움)
  • 분산 학습 시 통신 오버헤드

사용 사례

Mixtral 8x7B / 8x22B (Mistral AI) GPT-4 (추정) Switch Transformer (Google) Grok (xAI) DeepSeek-V2 (DeepSeek)