형식적 증명은 초인적 성능 수준에서 신뢰성 있게 정렬되고 제어 가능한 고급 AI 시스템을 구축하는 것이 가능함을 보여준다. 저자들은 사전에 고정된 매개변수를 사용하여 정렬, 제어 효과성 및 신뢰성에 필요한 모든 수학적 조건을 만족하는 정책, 환경 및 제어 메커니즘을 명시적으로 구성함으로써 이를 입증한다.

  • 시스템은 정의된 벤치마크에서 초인적 성능을 달성하며, 적어도 99%의 작업에서 전문가 인간 성능의 상위 99백분위수를 초과하고 하위 1% 미만으로 중앙값 이하로 떨어지지 않는다.
  • 정렬은 목적 함수 충실도, 행동 최적성 및 선호 안정성을 통해 검증되며, 내부 목적 함수는 주인의 효용과 정확히 일치한다.
  • 제어 효과성에는 드리프트, 적대적 섭동 및 모델 오특정화에 대한 강건성이 포함되며, 빈 개입 집합을 통해 최소한의 침습성이 보장된다.
  • 신뢰성은 T=1의 지평선에 대해 증명되며, 지정된 환경 클래스 내에서 정렬 실패 확률이 0임을 보여준다.

이 구성은 고급 AI 시스템이 신뢰성 있게 정렬될 수 없다는 가설을 반증하며, 이는 임의의 시스템에 대한 검증 또는 인증과 관련된 불가능 결과와 모순되지 않음을 명확히 한다.