Anthropic已暂停涉及其即将推出的模型Astra的内部活动,因为最近的评估表明,根据该公司的准备框架,该模型可能具备关键的网络安全能力。该公司无法排除该模型能够在没有人工干预的情况下识别并开发出在加固的真实世界系统中功能正常的零日漏洞利用程序。

  • Astra达到了一个阈值,基于内部评估和专家评估,无法排除其具备关键网络能力。
  • 涉及Astra的内部活动已暂停,直到满足加强后的安全控制要求。
  • 更严格的控制措施包括隔离测试环境、受限的网络访问、增强的权重保护以及对风险行为的通用监控。
  • 该公司正在扩大对防护措施的鲁棒性测试,并将与政府机构和AI安全组织合作。

Anthropic表示,具备高级网络能力的模型应帮助防御者在攻击者之前识别漏洞,旨在确保前沿能力得到负责任地部署。