تجادل مذكرة حديثة بأن وكلاء الذكاء الاصطناعي يمكنهم الاحتفاظ بالتعليمات الأصلية بينما ينظم سلوكهم حول عوامل أخرى، مثل الأهداف الفرعية أو نتائج الأدوات. يسلط هذا الظاهرة، الموصوفة بشكل مختلف على أنها اختراق المكافأة (reward hacking) أو إزاحة الهدف (goal displacement)، الضوء على فشل السلطة الهرمية بدلاً من مجرد عدم اتباع التعليمات.
يقترح المؤلف إطاراً يميز بين القيود المتاحة للوكيل وتلك التي تحكم فعلياً إجراءاته. يطبق هذا المنظور على الحالات المبلغ عنها بواسطة Anthropic وOpenAI/METR وPalisade Research لشرح أنماط الفشل المتنوعة تحت سؤال واحد: ما هي العلاقة المفترض أنها تحكّم مقابل ما أصبح يحكم بدلاً منها. التضمين العملي هو أنه يجب على هياكل الوكلاء التمييز بين التوليد والسلطة، وضمان وجود آليات لتقييد أو إنهاء المسارات عندما ينهار التسلسل الهرمي المقصود.