ヤン・ライケについて
ヤン・ライケは、1986年または1987年生まれの
ドイツ出身のAIアラインメント研究者であり、これまでにDeepMindや
OpenAIでの実績を積んできました。2024年5月からは、
Anthropicのアラインメント科学チームを共同でリードし、AIと
人間の意図を調和させるための研究に取り組んでいます。
生涯と経歴
学歴
ライケはフライブルク大学で学士号および計算機科学の修士号を取得しました。在学中は主にソフトウェア検証に関する研究に従事し、2012年頃から人工知能の
安全性に関心を持つようになりました。
オーストラリア国立大学でマーカス・ハッターの指導の下、博士論文として「Nonparametric General Reinforcement Learning」を執筆し、2016年に博士号を取得しました。
DeepMindでの活動(2016〜2020年)
ライケは、博士課程修了後に
オックスフォード大学にて短期のポスドク研究員を経て、2016年にDeepMindに入社しました。彼は同社で経験的AIセーフティのチームに属し、
人間のフィードバックを活用した
強化学習(RLHF)の研究を行いました。2017年には、
ポール・クリスティアーノやシェーン・レッグと共に「Deep Reinforcement Learning from Human Preferences」という論文を発表し、この手法は後に多くの言語モデルのアラインメント基盤となりました。
OpenAIでの活動(2021〜2024年)
ライケは2021年に
OpenAIに移籍し、アラインメントチームのリーダーとしてInstructGPTや
GPT-4のアラインメントに関与しました。2023年には「スーパーアラインメント」チームの共同リーダーとなり、このチームは
超知能AIのアラインメント問題に取り組むことを目指しています。2023年にはTIME誌の「AIにおける最も影響力ある100人」に選出され、2024年にも再度同選出が行われました。2024年5月には
OpenAIを退職し、安全
文化の重要性が軽視されていたことを懸念する意見を表明しました。
2024年5月28日、ライケは
Anthropicでの活動を開始すると発表しました。新しいチームではスケーラブルな監視や知識の汎化、自動化されたアラインメント研究者の訓練手法の開発に励んでいます。
主要な研究テーマ
ライケの研究の主要なテーマは、AIアラインメントの難題をどのように解決するかに焦点を当てています。特に、以下のような考え方が挙げられます。
人間のフィードバックによる強化学習(RLHF)
ライケはDeepMind在籍中にRLHFの手法を試作したことがあり、これは
人間の選好を基にAIを訓練する重要な手法として広く認知されています。このアプローチでは、2つの行動サンプルから
人間が好む方を選ぶことによってAIを訓練します。
RLHFのスケーリング限界とスケーラブルな監視
彼はRLHFの現行のアプローチが将来の
超知能には適さないと考えており、AIシステムが
人間よりも高度な仕事を行うシナリオでは、
人間がその結果を正しく評価できなくなるという問題点を指摘しています。この問題の解決策として提唱されるのが、「スケーラブルな監視」という手法です。
弱から強への汎化
OpenAIの研究チームによる最近の成果において、低い能力を持つモデルが高い能力を持つモデルの潜在的な能力を引き出せることが示されています。このアプローチは、今後の
超知能システムにおけるアラインメント問題への有力な解決策とされます。
スーパーアラインメントの構想
ライケは、次世代のAIモデルの段階的なアラインメントが重要であるという意見を持っており、
人間レベルのAI研究者を訓練してそれを利用することで、より高度なシステムの自動化されたアラインメントを目指しています。
発言や考え方
ライケの思想を理解する上で重要なキーワードに関する彼の発言も注目されています。彼は、現在のRLHFの限界やスケーラブルな監視の必要性、AGI開発の危険性と責任について率直な見解を述べています。
主な論文・著作