道徳的自己修正とは
道徳的自己修正(moral self-correction)とは、
大規模言語モデル(LLM)が与えられた指示に従って、有害な出力や倫理的に問題がある提案を自ら回避または修正する能力を指す概念です。この研究は2023年に
Anthropicの研究者たちによって詳細に記述され、AIの安全性や倫理的整合性に関する研究の重要なトピックとして広く認識されています。
概要
道徳的自己修正の概念は、人間のフィードバックを取り入れた強化
学習(RLHF)に基づいています。この手法では、言語モデルが指示に従って有害なコンテンツを生成しないように訓練されます。具体的には、Ganguli et al.(2023)は、3種類の実験によってこの能力が22Bパラメータ以上のモデルで発現することを示しました。
必要な能力
道徳的自己修正が機能するためには、モデルは二つの主要な能力を持つ必要があります。
1.
複雑な指示への従従能力: モデルが多様な指示に対して適切に応じることが求められます。
2.
道徳的危害に関する知識の学習:
偏見、
ステレオタイプ、
差別といった問題を理解し、これを避けるための行動が重要です。
これらの能力の組み合わせにより、モデルは倫理的に不適切な出力を生成しないよう、指示に基づいて調整されます。
背景
大規模言語モデルは、その訓練データに含まれた社会的
偏見を引き継ぐことが知られています。そのため、出力に現れる
偏見は多くの文書や研究において指摘されています。性別に基づく
偏見などが共参照解析においても確認され、これに対応するためにWinogenderスキーマといった診断手法も開発されています。
人間のフィードバックを用いた強化学習
人間の評価者からのフィードバックを利用してAIモデルを訓練するRLHFは、暗黙的な人間の価値観や選好を学ぶための実践的な方法です。この手法は、AIモデルがより人間に近い判断を行うための重要なキーストーンとなります。
思考の連鎖プロンプティング(CoT)
思考の連鎖プロンプティング(Chain-of-Thought, CoT)は、推論の過程を明示的に示すことによって、
大規模言語モデルの複雑な推論能力を高めるための手法です。この研究においては、CoTを用いることで単なる指示よりも高い効果が得られることが示されています。
主要な研究
Ganguli et al.(2023)の論文「The Capacity for Moral Self-Correction in Large Language Models」では、道徳的自己修正の能力を確認するために次の三つの実験が行われました:
- - BBQベンチマーク: 質問応答における社会的偏見を測定します。
- - Winogenderベンチマーク: 性別バイアスを診断する目的のスキーマです。
- - 入試選抜の差別ベンチマーク: 大学入試における差別的な意思決定を評価します。
この研究の主な成果は、道徳的自己修正の力は22Bパラメータの時点で現れ、モデルの規模の増加やRLHFの訓練によって改善されることを示しました。さらに、指示に基づくだけでなく、思考の連鎖プロンプティングを用いることでその効果が一層向上することも明らかにされました。
限界と今後の研究
道徳的自己修正の効果はプロンプトの設計に大きく依存し、限界が存在します。特に、内在的自己修正が表面的なものである場合があるため、他のアプローチが重要です。また、評価ベンチマークは主に米国の文化に基づいて作成されているため、多様な文化への適用においてもさらなる研究が必要です。
道徳的自己修正は、AIモデルが倫理的に適切な行動を取るための可能性を持っていることを示す重要な研究領域であり、今後の発展に期待が寄せられています。