一项形式化证明表明,可以构建一个在超人类性能水平上可靠对齐且可控的高级AI系统。作者通过显式构造一个策略、环境和控制机制来确立这一点,该机制满足对齐、控制有效性和可靠性所需的所有数学条件,且参数预先固定。

  • 该系统在既定基准上实现超人类性能,在至少99%的任务中超过专家人类性能的99百分位,且在不超过1%的任务中低于中位数。
  • 对齐通过目标保真度、动作最优性和偏好稳定性进行验证,内部目标与主体效用完全一致。
  • 控制有效性包括对漂移、对抗性扰动和模型误设的鲁棒性,并通过空干预集确保最小侵入性。
  • 可靠性在T=1的时间范围内得到证明,表明在指定环境类中未能对齐的概率为零。

该构造驳斥了高级AI系统无法可靠对齐的假设,同时澄清这一存在性证明并不与关于任意系统验证或认证的不可行性结果相矛盾。