Anthropic正与埃森哲的专业AI业务部门合作,对其前沿模型进行独立评估和红队测试。该举措支持Anthropic将评估人员嵌入公司内部的承诺,使其能够监控模型开发并验证安全承诺。

  • 合作伙伴关系涉及评估模型、进行对齐性评估以及测试安全措施。
  • 两家公司预计在未来五年内在此领域投资至少10亿美元。
  • 嵌入式评估人员将获得与员工相当的访问权限,以观察训练过程并识别盲点。
  • Anthropic将直接资助埃森哲的工作,同时探索未来评估人员的其他资金安排。

这种方法旨在通过允许独立方评估模型的构建和部署方式来提高可问责性,尽管此类嵌入式评估的标准仍在开发中。