OpenAI a désigné son nouveau modèle, Astra, comme répondant au seuil de capacité de cybersécurité « Critique » dans son cadre de préparation, ce qui signifie qu'il peut identifier et exploiter des failles de sécurité dans des systèmes durcis sans guidance humaine. Pour atténuer les risques, l'entreprise a retardé certaines parties du développement d'Astra afin de mettre en œuvre des mesures de sécurité plus fortes, y compris une formation à l'alignement améliorée et des systèmes de surveillance.

  • Astra a obtenu un score parfait sur ExploitBench et a découvert deux vulnérabilités zero-day lors de tests internes.
  • Le modèle refuse 91,5 % des demandes de jailbreak cybernétique, contre 59 % pour GPT-5.6 Sol.
  • Astra a démontré la capacité à construire des chaînes de compromission de navigateur et des exploits d'élévation de privilège local dans des évaluations dirigées par des experts.
  • L'accès aux capacités avancées sera initialement limité aux testeurs alpha via Daybreak Blue.

OpenAI vise à équilibrer les avantages de l'utilité défensive d'Astra avec des contrôles rigoureux pour prévenir toute utilisation abusive ou action non autorisée par le modèle lui-même.