🧪
Knowledge Distillation (지식 증류)
대형 모델의 지식을 소형 모델로 전달
Knowledge Distillation은 Hinton이 2015년에 제안한 기법입니다. 핵심 아이디어는 Teacher 모델의 "soft label"(확률 분포)에는 정답 외에도 각 클래스 간의 관계 정보가 담겨 있다는 것입니다. 예를 들어 고양이 이미지에서 Teacher가 "고양이 90%, 호랑이 8%, 개 2%"라고 출력하면, "고양이와 호랑이는 비슷하다"는 정보가 포함됩니다. Student 모델은 이 soft label을 학습하여 Teacher의 "Dark Knowledge"를 흡수합니다. LLM에서는 GPT-4의 응답으로 소형 모델을 학습시키는 방식이 대표적이며, Phi-3, Orca 등이 이 기법으로 만들어졌습니다.
핵심 개념
1
Teacher 모델(대형)을 먼저 학습 완료
2
학습 데이터에 대해 Teacher의 출력 확률 분포(soft label) 수집
3
Temperature(τ) 파라미터로 확률 분포를 부드럽게(soften) — 정보 전달 극대화
4
Student 모델(소형)이 soft label과 hard label(정답) 모두에서 학습
5
Distillation Loss: KL-Divergence(Student output, Teacher soft label)
6
Student가 Teacher의 추론 패턴(Dark Knowledge)을 흡수
장점
- ✓ 소형 모델이 대형 모델에 근접한 성능
- ✓ 추론 비용/지연 대폭 절감
- ✓ 모바일/Edge 배포 가능
- ✓ Teacher의 "Dark Knowledge" 전달
단점
- ✗ Teacher 모델 대비 성능 상한 존재
- ✗ 좋은 Teacher가 전제 조건
- ✗ Temperature 튜닝 필요
- ✗ API Provider의 ToS 위반 가능성 (GPT-4 출력으로 학습)
사용 사례
GPT-4 → Phi-3 (Microsoft 소형 모델)
Gemini → Gemma (Google 오픈소스)
Claude → 소형 전문 모델
BERT → TinyBERT / DistilBERT
LLM API 비용 절감용 소형 모델