ヤン・ライケ

ヤン・ライケについて



ヤン・ライケは、1986年または1987年生まれのドイツ出身のAIアラインメント研究者であり、これまでにDeepMindやOpenAIでの実績を積んできました。2024年5月からは、Anthropicのアラインメント科学チームを共同でリードし、AIと人間の意図を調和させるための研究に取り組んでいます。

生涯と経歴



学歴


ライケはフライブルク大学で学士号および計算機科学の修士号を取得しました。在学中は主にソフトウェア検証に関する研究に従事し、2012年頃から人工知能の安全性に関心を持つようになりました。オーストラリア国立大学でマーカス・ハッターの指導の下、博士論文として「Nonparametric General Reinforcement Learning」を執筆し、2016年に博士号を取得しました。

DeepMindでの活動(2016〜2020年)


ライケは、博士課程修了後にオックスフォード大学にて短期のポスドク研究員を経て、2016年にDeepMindに入社しました。彼は同社で経験的AIセーフティのチームに属し、人間のフィードバックを活用した強化学習(RLHF)の研究を行いました。2017年には、ポール・クリスティアーノやシェーン・レッグと共に「Deep Reinforcement Learning from Human Preferences」という論文を発表し、この手法は後に多くの言語モデルのアラインメント基盤となりました。

OpenAIでの活動(2021〜2024年)


ライケは2021年にOpenAIに移籍し、アラインメントチームのリーダーとしてInstructGPTやGPT-4のアラインメントに関与しました。2023年には「スーパーアラインメント」チームの共同リーダーとなり、このチームは超知能AIのアラインメント問題に取り組むことを目指しています。2023年にはTIME誌の「AIにおける最も影響力ある100人」に選出され、2024年にも再度同選出が行われました。2024年5月にはOpenAIを退職し、安全文化の重要性が軽視されていたことを懸念する意見を表明しました。

Anthropicでの新たな挑戦(2024年〜)


2024年5月28日、ライケはAnthropicでの活動を開始すると発表しました。新しいチームではスケーラブルな監視や知識の汎化、自動化されたアラインメント研究者の訓練手法の開発に励んでいます。

主要な研究テーマ


ライケの研究の主要なテーマは、AIアラインメントの難題をどのように解決するかに焦点を当てています。特に、以下のような考え方が挙げられます。

人間のフィードバックによる強化学習(RLHF)


ライケはDeepMind在籍中にRLHFの手法を試作したことがあり、これは人間の選好を基にAIを訓練する重要な手法として広く認知されています。このアプローチでは、2つの行動サンプルから人間が好む方を選ぶことによってAIを訓練します。

RLHFのスケーリング限界とスケーラブルな監視


彼はRLHFの現行のアプローチが将来の超知能には適さないと考えており、AIシステムが人間よりも高度な仕事を行うシナリオでは、人間がその結果を正しく評価できなくなるという問題点を指摘しています。この問題の解決策として提唱されるのが、「スケーラブルな監視」という手法です。

弱から強への汎化


OpenAIの研究チームによる最近の成果において、低い能力を持つモデルが高い能力を持つモデルの潜在的な能力を引き出せることが示されています。このアプローチは、今後の超知能システムにおけるアラインメント問題への有力な解決策とされます。

スーパーアラインメントの構想


ライケは、次世代のAIモデルの段階的なアラインメントが重要であるという意見を持っており、人間レベルのAI研究者を訓練してそれを利用することで、より高度なシステムの自動化されたアラインメントを目指しています。

発言や考え方


ライケの思想を理解する上で重要なキーワードに関する彼の発言も注目されています。彼は、現在のRLHFの限界やスケーラブルな監視の必要性、AGI開発の危険性と責任について率直な見解を述べています。

主な論文・著作



  • -

もう一度検索

【記事の利用について】

タイトルと記事文章は、記事のあるページにリンクを張っていただければ、無料で利用できます。
※画像は、利用できませんのでご注意ください。

【リンクついて】

リンクフリーです。