OpenAI发布了一个框架,概述了其支持独立第三方对前沿AI模型进行评估的方法。该组织强调,这些评估对于平衡责任与问责至关重要,需要深入访问训练、评估和部署数据。

  • 对涵盖训练、内部部署和外部部署的安全案例进行独立评估。
  • 针对对抗性测试、越狱和高风险领域的能力提升,评估关键保障措施。
  • 评估涵盖准备度风险类别(如网络安全和生物风险)的能力指标。
  • 调查关键的不对齐事件,以确定促成因素和保障措施的有效性。

该框架旨在建立共享的国际安全和安全实践标准,使评估人员能够通过严格、安全且独立的工作来挑战实验室的假设并验证安全声明。