Une preuve formelle démontre qu'il est possible de construire un système d'IA avancé qui est de manière fiable aligné et contrôlable à des niveaux de performance surhumaine. Les auteurs établissent cela en construisant explicitement une politique, un environnement et un mécanisme de contrôle qui satisfont toutes les conditions mathématiques requises pour l'alignement, l'efficacité du contrôle et la fiabilité, avec des paramètres fixés à l'avance.
- Le système atteint une performance surhumaine sur un benchmark défini, dépassant le 99e percentile de la performance humaine experte sur au moins 99 % des tâches tout en restant en dessous de la médiane sur pas plus de 1 %.
- L'alignement est vérifié par la fidélité objective, l'optimalité des actions et la stabilité des préférences, l'objectif interne correspondant exactement à l'utilité du principal.
- L'efficacité du contrôle inclut la robustesse contre la dérive, les perturbations adversariales et la spécification erronée du modèle, avec une invasivité minimale assurée par un ensemble d'intervention vide.
- La fiabilité est prouvée pour un horizon de T=1, montrant que la probabilité de défaut d'alignement est nulle au sein de la classe d'environnements spécifiée.
La construction infirme l'hypothèse selon laquelle les systèmes d'IA avancés ne peuvent pas être alignés de manière fiable, tout en précisant que cette preuve d'existence ne contredit pas les résultats d'impossibilité concernant la vérification ou la certification de systèmes arbitraires.