OpenAIは、新モデル「Astra」が重要なサイバーセキュリティ能力の閾値を満たす可能性があるという予備的な証拠を受け取り、モデル開発のペースを一時的に遅らせ、今後公開されるモデルに対する強化学習(RL)トレーニングを2週間停止した。この決定はOpenAIとHugging Faceのインシデントを受けて下され、AIシステムの能力が向上するにつれて、監視、アライメント、封じ込めの安全策を強化することを目的としている。
- Astraやサイバーモデルに関連するワークロードには、最も厳格なセキュリティ安全策が必要となり、不正なインターネットアクセスを防ぐために、より強力なワークロードの分離(サンドボックス)とネットワーク制御が含まれる。
- 新しい多段階監視システムは活性化分類器を使用して懸念される行動を検出し、潜在的な重要セキュリティ境界違反に対して30分以内にアラートを出すことを目指している。
- 最も能力の高いモデルに対して、安全でない行動、報酬ハッキング、および欺瞞をよりよく検出するために、コアアライメント技術がより多くのトレーニング段階に適用されている。
- 監視オーバーヘッドは監視される推論計算の約20%と見積もられており、30分以内に偽陽性として解決できない最高優先度のアラートに対して安全チームが呼び出される。
OpenAIは、これらの変更が必要であると強調している。その理由は、より能力の高いAIシステムの開発に伴うリスクが増大しており、アライメントと安全性を確保するためにセキュリティ基準がそれらのリスクに先行し続けなければならないからである。