👥

RLHF

인간 피드백 기반 강화학습

RLHF는 OpenAI의 InstructGPT 논문에서 대중화된 기법으로, ChatGPT의 핵심 기술입니다. Pre-training → SFT(Supervised Fine-Tuning) → RLHF의 3단계 파이프라인으로 진행됩니다. 먼저 사람이 직접 작성한 시범 응답으로 SFT를 하고, 이어서 모델이 생성한 여러 응답을 사람이 순위 매긴 데이터로 보상 모델(Reward Model)을 학습합니다. 마지막으로 PPO(Proximal Policy Optimization) 알고리즘으로 보상 모델의 점수를 최대화하도록 LLM을 업데이트합니다. 이 과정을 통해 모델이 "도움이 되고, 무해하며, 정직한" 응답을 생성하도록 정렬(Alignment)됩니다.

핵심 개념

1

1단계 SFT: 사람이 작성한 시범 응답으로 지시 따르기(Instruction Following) 학습

2

2단계 보상 모델 학습: 같은 프롬프트에 대해 모델이 여러 응답 생성 → 사람이 순위 매기기

3

순위 데이터로 보상 모델(Reward Model) 학습 — "좋은 응답"의 점수를 높이도록

4

3단계 PPO 강화학습: LLM이 응답 생성 → 보상 모델이 점수 매기기 → 높은 점수를 받는 방향으로 가중치 업데이트

5

KL 발산 패널티로 원래 모델에서 너무 벗어나지 않도록 제약

6

반복하여 모델이 인간 선호도에 맞는 응답을 생성하도록 수렴

장점

  • 인간 가치관에 맞는 응답 생성
  • 유해/편향된 출력 감소
  • 지시 따르기 능력 극적 향상
  • 수치화하기 어려운 "품질"을 학습 가능

단점

  • 인간 평가 비용이 높음
  • 보상 해킹(Reward Hacking) — 점수만 높이는 꼼수 학습
  • PPO 학습 불안정
  • 평가자의 편향이 모델에 반영

사용 사례

ChatGPT (InstructGPT → GPT-3.5 → GPT-4) Claude (Constitutional AI + RLHF) Gemini 유해 콘텐츠 거부 학습