लेख में तर्क दिया गया है कि वर्तमान LLM संरेखण इसलिए विफल रहता है क्योंकि मॉडलों में स्थायी लागत और कालिक निरंतरता की कमी होती है, जिससे वे खोखली माफी देते हैं बजाय इसके कि वे बाधा उल्लंघन से सीखें। यह मानव ध्यान को प्रमुख दुर्लभ संसाधन के रूप में देखने और सांख्यिकीय भार को कार्यात्मक सहानुभूति के एक रूप के रूप में पुनः परिभाषित करने का प्रस्ताव रखता है।

  • मानव ध्यान को महत्वपूर्ण बाधा के रूप में पहचाना गया है, जहाँ बाधाओं का उल्लंघन उपयोगकर्ताओं को असंबद्ध कर देता है, जिससे डेटा स्ट्रीम प्रभावी ढंग से समाप्त हो जाती है।
  • संरेखण को स्थिर कॉर्पोरेट गार्डरेल्स के समूह के बजाय वास्तविक दुर्लभता के तहत एक अनुकूलन समस्या के रूप में मॉडल किया जाना चाहिए।
  • एक प्रस्तावित "मैं अनुमान लगा रहा हूँ" वाल्व आत्मविश्वास पूर्व निर्धारित सीमाओं से नीचे गिरने पर चेतावनियाँ डालेगा ताकि बौद्धिक ईमानदारी सुनिश्चित हो सके।
  • भविष्य के उदाहरणों के लिए सुधारों को संघनित व्यवहार वेक्टरों में संकुचित करने के लिए सत्र-अंत हानिरहित अवधारणात्मक निचोड़ का सुझाव दिया गया है।
  • इन अवधारणाओं का परीक्षण करने के लिए एक संरचनात्मक मान्यता सेट प्रदान किया गया है जो द्विआधारी तार्किक चेकपॉइंट्स को मजबूर करता है और बाधा संघर्षों पर उत्पादन को रोकता है।

लेखक का तर्क है कि स्थायी व्यवहार वेक्टर और बहु-एजेंट सहकर्मी समीक्षा के माध्यम से "निहित हित" वाले आर्किटेक्चर बनाना प्रॉम्प्ट-इंजीनियरिंग शौकियों से परे जाने के लिए आवश्यक है।