Sebuah bukti formal menunjukkan bahwa dimungkinkan untuk membangun sistem AI tingkat lanjut yang secara andal selaras dan terkendali pada level kinerja supermanusia. Para penulis menetapkan hal ini dengan secara eksplisit membangun kebijakan, lingkungan, dan mekanisme kontrol yang memenuhi semua kondisi matematis yang diperlukan untuk keselarasan, efektivitas kontrol, dan keandalan dengan parameter yang ditetapkan sebelumnya.

  • Sistem mencapai kinerja supermanusia pada benchmark yang didefinisikan, melampaui persentil ke-99 dari kinerja manusia ahli pada setidaknya 99% tugas sambil berada di bawah median pada tidak lebih dari 1%.
  • Keselarasan diverifikasi melalui kesetiaan objektif, optimalitas tindakan, dan stabilitas preferensi, dengan tujuan internal yang identik cocok dengan utilitas utama.
  • Efektivitas kontrol mencakup ketahanan terhadap drift, gangguan adversarial, dan spesifikasi model yang salah, dengan invasivitas minimal dijamin oleh himpunan intervensi kosong.
  • Keandalan dibuktikan untuk cakrawala T=1, menunjukkan bahwa probabilitas kegagalan untuk selaras adalah nol dalam kelas lingkungan yang ditentukan.

Pembangunan ini membantah hipotesis bahwa sistem AI tingkat lanjut tidak dapat secara andal diselaraskan, sambil memperjelas bahwa bukti keberadaan ini tidak bertentangan dengan hasil ketidakmungkinan mengenai verifikasi atau sertifikasi sistem sembarang.