🧪

Knowledge Distillation (지식 증류)

대형 모델의 지식을 소형 모델로 전달

Knowledge Distillation은 Hinton이 2015년에 제안한 기법입니다. 핵심 아이디어는 Teacher 모델의 "soft label"(확률 분포)에는 정답 외에도 각 클래스 간의 관계 정보가 담겨 있다는 것입니다. 예를 들어 고양이 이미지에서 Teacher가 "고양이 90%, 호랑이 8%, 개 2%"라고 출력하면, "고양이와 호랑이는 비슷하다"는 정보가 포함됩니다. Student 모델은 이 soft label을 학습하여 Teacher의 "Dark Knowledge"를 흡수합니다. LLM에서는 GPT-4의 응답으로 소형 모델을 학습시키는 방식이 대표적이며, Phi-3, Orca 등이 이 기법으로 만들어졌습니다.

핵심 개념

1

Teacher 모델(대형)을 먼저 학습 완료

2

학습 데이터에 대해 Teacher의 출력 확률 분포(soft label) 수집

3

Temperature(τ) 파라미터로 확률 분포를 부드럽게(soften) — 정보 전달 극대화

4

Student 모델(소형)이 soft label과 hard label(정답) 모두에서 학습

5

Distillation Loss: KL-Divergence(Student output, Teacher soft label)

6

Student가 Teacher의 추론 패턴(Dark Knowledge)을 흡수

장점

  • 소형 모델이 대형 모델에 근접한 성능
  • 추론 비용/지연 대폭 절감
  • 모바일/Edge 배포 가능
  • Teacher의 "Dark Knowledge" 전달

단점

  • Teacher 모델 대비 성능 상한 존재
  • 좋은 Teacher가 전제 조건
  • Temperature 튜닝 필요
  • API Provider의 ToS 위반 가능성 (GPT-4 출력으로 학습)

사용 사례

GPT-4 → Phi-3 (Microsoft 소형 모델) Gemini → Gemma (Google 오픈소스) Claude → 소형 전문 모델 BERT → TinyBERT / DistilBERT LLM API 비용 절감용 소형 모델