एक औपचारिक प्रमाण दर्शाता है कि एक उन्नत एआई प्रणाली का निर्माण करना संभव है जो मानव-परक प्रदर्शन स्तरों पर विश्वसनीय रूप से संरेखित और नियंत्रणीय हो। लेखकों ने इसे स्पष्ट रूप से एक नीति, वातावरण और नियंत्रण तंत्र का निर्माण करके स्थापित किया है जो संरेखण, प्रभावशाली नियंत्रण और विश्वसनीयता के लिए आवश्यक सभी गणितीय शर्तों को पूरा करता है, जिनमें पैरामीटर पूर्व-निर्धारित रूप से स्थिर हैं।
- प्रणाली एक परिभाषित बेंचमार्क पर मानव-परक प्रदर्शन प्राप्त करती है, कम से कम 99% कार्यों पर विशेषज्ञ मानव प्रदर्शन के 99वें प्रतिशत को पार करते हुए, और अधिकतम 1% कार्यों में मध्यिका से नीचे गिरते हुए।
- संरेखण वस्तुनिष्ठ विश्वसनीयता, क्रिया की इष्टतमता और प्राथमिकता स्थिरता के माध्यम से सत्यापित किया जाता है, जिसमें आंतरिक उद्देश्य मुख्य उपयोगिता से पूर्णतः मेल खाता है।
- नियंत्रण प्रभावशालिता में विचलन, शत्रुतापूर्ण विक्षोभ और मॉडल अस्पष्टीकरण के प्रति दृढ़ता शामिल है, जिसमें एक खाली हस्तक्षेण सेट द्वारा न्यूनतम आक्रामकता सुनिश्चित की गई है।
- विश्वसनीयता T=1 के क्षितिज के लिए सिद्ध होती है, यह दर्शाते हुए कि निर्दिष्ट वातावरण वर्ग के भीतर संरेखण में विफलता की प्रायिकता शून्य है।
इस निर्माण से यह परिकल्पना को असत्य साबित करता है कि उन्नत एआई प्रणालियों को विश्वसनीय रूप से संरेखित नहीं किया जा सकता, जबकि स्पष्ट करता है कि यह अस्तित्व प्रमाण मनमाने प्रणालियों के सत्यापन या प्रमाणन से संबंधित असंभवता परिणामों का विरोधाभासी नहीं है।