🏢
Mixture of Experts (MoE)
필요한 전문가만 활성화하여 효율적 스케일링
Mixture of Experts(MoE)는 모델 파라미터 수와 실제 연산량을 분리하는 아키텍처입니다. 기존 Dense 모델은 모든 입력에 모든 파라미터를 사용하지만, MoE는 라우터(Router/Gate)가 각 토큰마다 상위 k개의 전문가만 선택하여 활성화합니다. 예를 들어 Mixtral 8x7B는 총 47B 파라미터이지만, 각 토큰당 2개의 Expert만 활성화하여 실제 연산은 13B 모델 수준입니다. GPT-4도 MoE 아키텍처로 알려져 있습니다. 큰 모델의 품질을 유지하면서 추론 비용을 줄이는 핵심 기술입니다.
핵심 개념
1
입력 토큰이 라우터(Gate Network)에 전달
2
라우터가 각 Expert에 대한 확률(가중치)을 계산
3
상위 k개 Expert만 선택 (보통 k=2)
4
선택된 Expert들이 각각 독립적으로 입력 처리
5
Expert 출력을 라우터 가중치로 가중 평균하여 최종 출력 생성
6
Load Balancing Loss로 특정 Expert에 토큰이 몰리지 않도록 제어
장점
- ✓ 같은 연산량으로 더 높은 성능 (Dense 대비)
- ✓ 파라미터 스케일링이 용이
- ✓ 각 Expert가 자연스럽게 전문화
- ✓ 추론 비용 효율적
단점
- ✗ 메모리 사용량은 전체 파라미터 기준 (큼)
- ✗ Expert 간 부하 불균형 문제
- ✗ 학습 불안정 (라우터 학습 어려움)
- ✗ 분산 학습 시 통신 오버헤드
사용 사례
Mixtral 8x7B / 8x22B (Mistral AI)
GPT-4 (추정)
Switch Transformer (Google)
Grok (xAI)
DeepSeek-V2 (DeepSeek)