🎯
AI Alignment (정렬)
AI를 인간의 의도와 가치에 맞게 작동시키기
AI Alignment은 AI 시스템의 목표와 행동을 인간의 의도, 가치, 윤리에 맞추는 연구 분야입니다. 강력한 AI가 인간의 의도와 어긋나면 심각한 위험이 될 수 있다는 인식에서 출발합니다. Anthropic의 "Helpful, Harmless, Honest(HHH)" 프레임워크가 대표적입니다. 기술적으로는 RLHF, Constitutional AI, DPO 등으로 구현되며, 연구 주제로는 Reward Hacking(보상 해킹), Goal Misgeneralization(목표 오일반화), Deceptive Alignment(기만적 정렬) 등이 있습니다. 단기적으로는 유해 출력 방지, 장기적으로는 초인적 AI의 안전한 운영이 목표입니다.
핵심 개념
1
인간 가치/의도 정의 — "Helpful, Harmless, Honest" 같은 원칙 수립
2
SFT로 기본적인 지시 따르기 학습
3
RLHF/DPO/Constitutional AI로 인간 선호도에 맞게 정렬
4
Red Teaming — 적대적 테스트로 취약점 발견
5
안전장치 구현 — 유해 요청 거부, 불확실성 표현 등
6
지속적 모니터링 — 배포 후 실제 사용에서 문제 발견 및 수정
장점
- ✓ 유해 출력 감소
- ✓ 사용자 신뢰도 향상
- ✓ 규제 준수
- ✓ AI 장기 안전성 확보
단점
- ✗ "정렬"의 정의가 주관적
- ✗ 과도한 안전 필터가 유용성 저하 (과도한 거부)
- ✗ 정렬 세금(Alignment Tax) — 성능 하락
- ✗ 기만적 정렬 감지 어려움
사용 사례
ChatGPT/Claude의 안전 필터
AI 정책/규제 프레임워크
Red Teaming 서비스
AI Safety 연구소 (Anthropic, DeepMind)