Uma prova formal demonstra que é possível construir um sistema avançado de IA que seja confiavelmente alinhado e controlável em níveis de desempenho super-humanos. Os autores estabelecem isso construindo explicitamente uma política, ambiente e mecanismo de controle que satisfazem todas as condições matemáticas exigidas para alinhamento, eficácia do controle e confiabilidade, com parâmetros fixados antecipadamente.

  • O sistema alcança desempenho super-humano em um benchmark definido, excedendo o percentil 99 do desempenho humano especialista em pelo menos 99% das tarefas, enquanto fica abaixo da mediana em não mais de 1%.
  • O alinhamento é verificado por fidelidade ao objetivo, otimalidade da ação e estabilidade das preferências, com o objetivo interno correspondendo exatamente à utilidade principal.
  • A eficácia do controle inclui robustez contra deriva, perturbação adversarial e especificação incorreta do modelo, com invasividade mínima garantida por um conjunto de intervenção vazio.
  • A confiabilidade é provada para um horizonte de T=1, mostrando que a probabilidade de falha no alinhamento é zero dentro da classe de ambientes especificada.

A construção refuta a hipótese de que sistemas avançados de IA não podem ser confiavelmente alinhados, ao mesmo tempo em que esclarece que esta prova de existência não contradiz resultados de impossibilidade relativos à verificação ou certificação de sistemas arbitrários.