OpenAI ha designado su nuevo modelo, Astra, como que cumple el umbral de capacidad de ciberseguridad "Crítica" bajo su Marco de Preparación, lo que significa que puede identificar y explotar vulnerabilidades de seguridad en sistemas endurecidos sin guía humana. Para mitigar los riesgos, la compañía retrasó partes del desarrollo de Astra para implementar medidas de seguridad más fuertes, incluyendo entrenamiento de alineación mejorado y sistemas de monitoreo.
- Astra obtuvo una puntuación perfecta en ExploitBench y descubrió dos vulnerabilidades de día cero durante pruebas internas.
- El modelo rechaza el 91.5% de las solicitudes de jailbreak cibernético, en comparación con el 59% para GPT-5.6 Sol.
- Astra demostró la capacidad de construir cadenas de compromiso del navegador y exploits de elevación de privilegios locales en evaluaciones dirigidas por expertos.
- El acceso a capacidades avanzadas estará inicialmente limitado a probadores alfa a través de Daybreak Blue.
OpenAI busca equilibrar los beneficios de la utilidad defensiva de Astra con controles rigurosos para prevenir el uso indebido o acciones no autorizadas por parte del modelo mismo.