OpenAI는 새로운 모델인 아스트라(Astra)가 자체 준비 프레임워크 하에서 "중대(Critical)" 사이버보안 능력 임계값을 충족한다고 지정했으며, 이는 인간 개입 없이 강화된 시스템의 보안 결함을 식별하고 악용할 수 있음을 의미합니다. 위험을 완화하기 위해 회사는 더 강력한 안전 조치를 구현하기 위해 아스트라 개발의 일부 단계를 지연시켰으며, 여기에는 개선된 정렬 훈련과 모니터링 시스템이 포함됩니다.

  • 아스트라는 ExploitBench에서 만점을 받았으며 내부 테스트 중 두 가지 제로데이 취약점을 발견했습니다.
  • 이 모델은 사이버 재일브레이크 요청의 91.5%를 거부했으며, 이는 GPT-5.6 Sol의 59%와 비교됩니다.
  • 아스트라는 전문가 주도 평가에서 브라우저 침해 체인과 로컬 권한 상승 악용 코드를 구축하는 능력을 입증했습니다.
  • 고급 기능에 대한 접근은 초기에는 Daybreak Blue를 통해 알파 테스터에게만 제한될 예정입니다.

OpenAI는 아스트라의 방어적 유용성의 이점을 모델 자체의 오용이나 무단 행위를 방지하기 위한 엄격한 통제와 균형 있게 맞추는 것을 목표로 합니다.