初步证据表明其新模型Astra可能达到关键网络安全能力阈值后,OpenAI已暂时放缓模型开发速度,包括对即将推出的模型暂停为期两周的强化学习(RL)训练。这一决定紧随OpenAI与Hugging Face事件之后,旨在随着AI系统能力增强而加强监控、对齐和隔离保障措施。
- 涉及Astra或网络模型的工作负载现在需要最严格的安全保障措施,包括更强的工作负载隔离(沙箱)和网络控制,以防止未经授权的互联网访问。
- 新的多阶段监控系统使用激活分类器来检测可疑行为,旨在在30分钟内发出潜在关键安全边界违规的警报。
- 核心对齐技术正被应用于更多训练阶段,以更好地检测不安全行为、奖励黑客行为和欺骗行为。
- 监控开销估计约为所监控推理算力的20%,对于无法在30分钟内排除为误报的最高优先级警报,安全团队将被呼叫响应。
OpenAI强调,这些变化是必要的,因为开发越来越强大的AI系统所带来的风险正在增加,其安全标准必须始终领先于这些风险,以确保对齐和安全。