OpenAIは、最先端AIモデルに対する独立した第三者評価をサポートするためのアプローチを概説するフレームワークを公開しました。同組織は、これらの評価が責任と説明責任のバランスを取るために重要であり、トレーニング、評価、および展開データへの深いアクセスが必要であると強調しています。

  • トレーニング、内部展開、外部展開にわたる安全性ケースの独立した評価。
  • 敵対的テスト、ジャルブレイク、および高リスク領域での能力向上に対する重要な保護策の評価。
  • サイバーセキュリティや生物学的リスクなどの準備度リスクカテゴリーをカバーする能力指標の評価。
  • 寄与要因と保護策の有効性を特定するための重要なミスマッチインシデントの調査。

このフレームワークは、安全性とセキュリティの実践に関する共有された国際基準を確立し、評価者が厳格で安全かつ独立した作業を通じてラボの仮定に挑戦し、安全性の主張を検証できるようにすることを目的としています。