責任あるスケーリングポリシー(RSP)について
概要
責任あるスケーリングポリシー(Responsible Scaling Policy、略称RSP)は、AIのフロンティア開発に関する重要な
リスクを評価し、緩和することを目的とした自主的な
リスクガバナンスの枠組みです。
Anthropicが2023年に初版を発表し、その後も改訂が行われています。RSPは、
高度なAIモデルが引き起こす可能性のある壊滅的な
リスクに対して、訓練や展開を行う際には必要な
安全対策を講じることを強く求める取り組みです。
背景と策定経緯
RSPは、非営利のAI
安全研究機関であるARC Evals(現METR)の提案を基にしています。METRは、AI開発者が
安全に対処できるAIの能力と、その能力を危険にさらさないための保護措置の改善が求められる条件を示したものとしてRSPを定義しています。
Anthropicでは、RSPの初版が業界における初の公開事例として位置づけられ、AIの
リスクを考慮した新たなフレームワークの構築を目指しています。
AIセーフティレベル(ASL)基準
RSPの核となるのがAIセーフティレベル基準(ASL Standards)です。これは、AIモデルの訓練および展開における技術的・運用的対策の枠組みであり、様々なレベルに分類されます。
- - ASL-1: 壊滅的リスクをほとんど持たないシステム。
- - ASL-2: 危険な能力の初期兆候が見られるが、実際には壊滅的なリスクには至らないシステム。
- - ASL-3: 化学兵器や生物兵器などに関する支援能力の初期兆候が見られるシステム。
- - ASL-4以上: より高度な能力を持つシステムで、セキュリティ対策が一層求められます。
この基準は、モデルの能力が向上する際には、それに伴った強固な
安全対策も必要になるという「比例的保護」の原則に基づいています。
バージョン履歴
RSPは2023年9月にv1.0が初版として公開され、続いて2024年にはv2.0、v2.1、v2.2が導入されました。これらはそれぞれ、実施経験からの教訓を反映した大規模な改訂です。
- - v1.0: 力量を超過する場合の訓練・展開の一時停止に関する条件付きコミットメントが明示。
- - v2.0: ケイパビリティ・スレッショルドおよび必要なセーフガードの概念が追加され、安全ケース手法による評価プロセスが強化。
- - v3.0: 一時停止コミットメントを削除し、業界全体における安全基準の向上を促進するためのフロンティア安全ロードマップ導入が行われました。
理論的基盤
RSPは、「条件付きコミットメント」という原則を基盤としています。特定の危険能力を超えた場合には、より厳格なセーフガードが適用されるという仕組みです。この枠組みは、内部の強制力を強化するほか、業界全体に影響を与えることで
安全基準を向上させることを目指しています。
評価と批判
RSPの導入に関しては、AIの
安全コミュニティから多様な評価が寄せられています。支持する意見も多い一方で、一部で懸念されるポイントも少なくないのが現状です。例えば、RSPが規制からの圧力を和らげるための表面的な措置に過ぎないといった指摘や、能力評価が主観的な判断に依存している点が批判されています。また、
ガバナンスAIからは、一時停止コミットメントの削除について懸念と評価が寄せられています。
まとめ
AnthropicのRSPは、AIの進化に伴う
リスクを軽減するための指針を示し、多くの業界プレーヤーや政府にとっても参考とされる枠組みです。将来のAIモデルがもたらす影響を考慮しつつ、
安全に技術を展開していくための重要な施策となるでしょう。
このように、責任あるスケーリングポリシーは、AI技術の信頼性や
安全性の向上に向けた一端を担い、社会全体に対しての意識の向上にも寄与していくと期待されています。