OpenAIは、新しいモデル「Astra」を、その準備フレームワークの下で「重要」なサイバーセキュリティ能力の閾値を満たすと指定した。これは、人間の指示なしに堅牢なシステムのセキュリティ脆弱性を特定し、悪用できることを意味する。リスクを軽減するため、同社はより強力な安全対策の実装のためにAstraの開発の一部を遅らせ、改善されたアライメントトレーニングと監視システムを含めた。
- AstraはExploitBenchで完璧なスコアを達成し、内部テスト中に2つのゼロデイ脆弱性を発見した。
- このモデルはGPT-5.6 Solの59%と比較して、サイバー脱獄リクエストの91.5%を拒否する。
- Astraは専門家主導の評価において、ブラウザ乗っ取りチェーンやローカル特権昇格エクスプロイトを構築する能力を示した。
- 高度な機能へのアクセスは、当初Daybreak Blueを通じてアルファテスターに限定される予定。
OpenAIは、Astraの防御的利点と、モデル自体による不正使用や許可されていない行動を防ぐための厳格な制御とのバランスを取ることを目指している。