OpenAI已将其新模型Astra指定为其准备框架下符合“关键”网络安全能力阈值的模型,这意味着它能够在无人工指导的情况下识别并利用加固系统中的安全漏洞。为了降低风险,该公司推迟了Astra部分功能的开发,以实施更严格的安全措施,包括改进的对齐训练和监控系统。
- Astra在ExploitBench上获得满分,并在内部测试中发现了两个零日漏洞。
- 该模型拒绝了91.5%的网络越狱请求,而GPT-5.6 Sol的拒绝率为59%。
- 在专家主导的评估中,Astra展示了构建浏览器入侵链和本地权限提升利用程序的能力。
- 高级功能的访问初期将仅限于通过Daybreak Blue进行Alpha测试的用户。
OpenAI旨在平衡Astra防御性用途带来的益处与严格的控制措施,以防止模型本身被滥用或执行未经授权的操作。