OpenAI 发布了初步指南,倡导在进行任何前沿强化学习训练运行之前,制定结构化的“安全案例”——即全面的、基于证据的风险论证。该组织旨在将这些实践确立为一种理想标准,以管理先进 AI 模型涌现的复杂性。
所提出的框架要求安全案例涵盖三个技术方面:对齐训练、隔离和监控。关键措施包括自动化和手动数据集审查、评分器调优、离线对齐评估以及回溯测试,以防止奖励黑客攻击和对齐偏差。隔离策略涉及加固沙箱基础设施、使用前沿检查点进行隔离红队测试、限制跨样本通信,并使用不可变日志进行事件调查。
运营最佳实践包括要求事前异议、拥有否决权的高级管理层批准,以及为训练运行定义责任。指南还概述了调查严重对齐偏差事件的协议,包括根本原因分析、公开披露以及创建回归测试以防止未来类似行为。
OpenAI 目前正在内部实施这些建议,并预计随着其内部安全流程的迭代,这些实践也将不断演进。