Формальное доказательство демонстрирует возможность создания продвинутой ИИ-системы, которая надёжно выровнена и контролируема на уровнях сверхчеловеческой производительности. Авторы устанавливают это путём явного построения политики, среды и механизма управления, которые удовлетворяют всем требуемым математическим условиям для выравнивания, эффективности контроля и надёжности при заранее фиксированных параметрах.
- Система достигает сверхчеловеческой производительности на определённом бенчмарке, превосся 99-й перцентиль экспертной человеческой производительности как минимум на 99% задач, при этом не опускаясь ниже медианы более чем на 1%.
- Выравнивание проверяется через объективную точность, оптимальность действий и стабильность предпочтений, при этом внутренняя цель полностью совпадает с полезностью агента.
- Эффективность контроля включает устойчивость к дрейфу, состязательным возмущениям и неверной спецификации модели, при этом минимальная инвазивность обеспечивается пустым множеством вмешательств.
- Надёжность доказана для горизонта T=1, показывая, что вероятность несовпадения с выравниванием равна нулю в рамках указанного класса сред.
Построение опровергает гипотезу о том, что продвинутые ИИ-системы не могут быть надёжно выровнены, одновременно уточняя, что это доказательство существования не противоречит результатам невозможности относительно верификации или сертификации произвольных систем.