📜
Constitutional AI(CAI)
憲法(原則)でAI自身を改善させる方法
Constitutional AI(CAI)はAnthropicが2022年に提案した技法で、Claudeの核心的アラインメント技術です。RLHFで人間が直接応答を評価するのはコストが高くスケールしにくいです。CAIは憲法(Constitution)— 「役に立つが害にならないこと」「差別的表現を避けること」等の原則 — をAIに提供します。Critiqueフェーズでは自身の応答を原則に照らして批判し、Revisionフェーズでは批判を反映して応答を修正します。この自己改善データでSFTとRLAIF(AIフィードバックに基づく強化学習)を実行します。
キーコンセプト
1
憲法(Constitution)定義 — 10〜20個の原則を作成(「無害であること」「正確であること」等)
2
Red Teaming: 有害なプロンプトで初期モデルの応答を収集
3
Critique: AIが憲法原則に照らして自身の応答を批判(「この応答は原則Xに違反する」)
4
Revision: AIが批判を反映して応答を修正(「原則Xを守るように修正すると…」)
5
修正された応答でSFTを実行
6
RLAIF: AIが生成した選好データで報酬モデルを学習 → 強化学習(人間評価の代わりにAI評価)
メリット
- ✓ 人間評価コストの大幅削減(RLAIF)
- ✓ 原則を明示的に文書化 → 監査可能
- ✓ スケーラブルなアラインメント
- ✓ 原則修正で行動調整が可能
デメリット
- ✗ AIの自己批判能力に依存
- ✗ 憲法原則間の衝突の可能性
- ✗ 原則が不完全なら盲点が存在
- ✗ 人間評価の完全な代替は困難
ユースケース
Claude(Anthropicの全モデル)
AI安全性研究
多言語アラインメント(各文化の原則適用)
企業カスタムAI価値観設定