Una prueba formal demuestra que es posible construir un sistema avanzado de IA que sea fiablemente alineado y controlable a niveles de rendimiento superhumano. Los autores establecen esto construyendo explícitamente una política, un entorno y un mecanismo de control que satisfacen todas las condiciones matemáticas requeridas para la alineación, la eficacia del control y la fiabilidad, con parámetros fijados de antemano.
- El sistema alcanza un rendimiento superhumano en un benchmark definido, superando el percentil 99 del rendimiento humano experto en al menos el 99% de las tareas mientras cae por debajo de la mediana en no más del 1%.
- La alineación se verifica mediante la fidelidad del objetivo, la optimalidad de la acción y la estabilidad de las preferencias, con el objetivo interno coincidiendo idénticamente con la utilidad principal.
- La eficacia del control incluye robustez frente a la deriva, perturbaciones adversarias y especificación incorrecta del modelo, asegurando una invasividad mínima mediante un conjunto de intervenciones vacío.
- La fiabilidad se demuestra para un horizonte de T=1, mostrando que la probabilidad de fallo en la alineación es cero dentro de la clase de entornos especificada.
La construcción refuta la hipótesis de que los sistemas avanzados de IA no pueden alinearse de forma fiable, mientras aclara que esta prueba de existencia no contradice los resultados de imposibilidad respecto a la verificación o certificación de sistemas arbitrarios.