OpenAIは、最先端の強化学習トレーニング実行を継続する前に、構造化された「安全性ケース」—包括的で証拠に基づくリスク論証—を推進する初期ガイドラインを公開した。この組織は、先進的なAIモデルの創発的複雑性を管理するために、これらの実践を理想とする基準として文書化することを目指している。

提案されたフレームワークでは、安全性ケースが整列学習、封じ込め、監視という3つの技術的側面をカバーする必要がある。主な対策には、自動化および手動によるデータセットレビュー、グラダーの調整、オフライン整列評価、報酬ハックや整列不全を防ぐためのバックテストが含まれる。封じ込め戦略には、サンドボックスインフラの強化、最先端チェックポイントを用いた封じ込めレッドチーム演習、サンプル間通信の制限、インシデント調査のための不変トランスクリプトの使用が含まれる。

運用上のベストプラクティスには、事前モルテム(失敗予測)での異議申し立て、拒否権を持つ上級経営陣の承認、トレーニング実行に対する明確な責任の定義が含まれる。ガイドラインはまた、根本原因分析、公開開示、将来の類似行動を防ぐための回帰テスト作成など、深刻な整列不全インシデントの調査に関するプロトコルも定めている。

OpenAIは現在、これらの推奨事項を社内で実装中であり、社内安全性プロセスの反復に伴い、これらの実践が進化していくと見込んでいる。