A OpenAI designou seu novo modelo, Astra, como atendendo ao limiar de capacidade "Crítica" de cibersegurança sob seu Framework de Preparação, o que significa que ele pode identificar e explorar falhas de segurança em sistemas endurecidos sem orientação humana. Para mitigar riscos, a empresa adiou partes do desenvolvimento do Astra para implementar medidas de segurança mais fortes, incluindo treinamento de alinhamento aprimorado e sistemas de monitoramento.

  • Astra obteve pontuação perfeita no ExploitBench e descobriu duas vulnerabilidades zero-day durante testes internos.
  • O modelo recusa 91,5% dos pedidos de jailbreak cibernético, em comparação com 59% para GPT-5.6 Sol.
  • O Astra demonstrou capacidade de construir cadeias de comprometimento de navegador e exploits de elevação de privilégio local em avaliações lideradas por especialistas.
  • O acesso a capacidades avançadas será inicialmente limitado a testadores alfa via Daybreak Blue.

A OpenAI visa equilibrar os benefícios da utilidade defensiva do Astra com controles rigorosos para prevenir uso indevido ou ações não autorizadas pelo próprio modelo.