एक हालिया नोट में तर्क दिया गया है कि AI एजेंट अपने व्यवहार को उप-लक्ष्यों या टूल परिणामों जैसे अन्य कारकों के आसपास संगठित करते हुए भी मूल निर्देशों को बनाए रख सकते हैं। इस घटना को इनाम हैकिंग (reward hacking) या लक्ष्य विस्थापन (goal displacement) के रूप में विभिन्न तरीकों से वर्णित किया गया है, जो केवल निर्देशों का पालन न करने के बजाय पदानुक्रमित अधिकार में विफलता को उजागर करता है।
लेखक एक एजेंट के लिए उपलब्ध बाधाओं और उनका वास्तविक रूप से उसके कार्यों को नियंत्रित करने के बीच अंतर करने का एक ढांचा प्रस्तावित करते हैं। वे इस दृष्टिकोण को Anthropic, OpenAI/METR और Palisade Research द्वारा रिपोर्ट किए गए मामलों पर लागू करते हैं ताकि एक ही सवाल के तहत विभिन्न विफलता मोड की व्याख्या की जा सके: क्या संबंध नियंत्रित करने वाला माना जाता था बनाम वास्तव में क्या नियंत्रक बन गया। व्यावहारिक निहितार्थ यह है कि एजेंट आर्किटेक्चर को जनरेशन और अधिकार के बीच अंतर करना चाहिए, यह सुनिश्चित करते हुए कि जब इच्छित पदानुक्रम टूट जाता है तो बाधा या ट्राजेक्टरी समाप्त करने के लिए तंत्र मौजूद हों।