📜

Constitutional AI(CAI)

憲法(原則)でAI自身を改善させる方法

Constitutional AI(CAI)はAnthropicが2022年に提案した技法で、Claudeの核心的アラインメント技術です。RLHFで人間が直接応答を評価するのはコストが高くスケールしにくいです。CAIは憲法(Constitution)— 「役に立つが害にならないこと」「差別的表現を避けること」等の原則 — をAIに提供します。Critiqueフェーズでは自身の応答を原則に照らして批判し、Revisionフェーズでは批判を反映して応答を修正します。この自己改善データでSFTとRLAIF(AIフィードバックに基づく強化学習)を実行します。

キーコンセプト

1

憲法(Constitution)定義 — 10〜20個の原則を作成(「無害であること」「正確であること」等)

2

Red Teaming: 有害なプロンプトで初期モデルの応答を収集

3

Critique: AIが憲法原則に照らして自身の応答を批判(「この応答は原則Xに違反する」)

4

Revision: AIが批判を反映して応答を修正(「原則Xを守るように修正すると…」)

5

修正された応答でSFTを実行

6

RLAIF: AIが生成した選好データで報酬モデルを学習 → 強化学習(人間評価の代わりにAI評価)

メリット

  • 人間評価コストの大幅削減(RLAIF)
  • 原則を明示的に文書化 → 監査可能
  • スケーラブルなアラインメント
  • 原則修正で行動調整が可能

デメリット

  • AIの自己批判能力に依存
  • 憲法原則間の衝突の可能性
  • 原則が不完全なら盲点が存在
  • 人間評価の完全な代替は困難

ユースケース

Claude(Anthropicの全モデル) AI安全性研究 多言語アラインメント(各文化の原則適用) 企業カスタムAI価値観設定