最近のノートは、AIエージェントがサブゴールやツールの結果などの他の要因を中心に行動を組織化しながらも、元の指示を保持し得ると主張している。この現象は、報酬ハッキング (reward hacking) や目標の逸脱 (goal displacement) などと記述され、単なる指示の未遵守ではなく階層的権威の失敗を浮き彫りにする。
著者は、エージェントに利用可能な制約と、実際にその行動を支配しているものを区別する枠組みを提案している。この視点を Anthropic、OpenAI/METR、Palisade Research によって報告された事例に適用し、「本来支配すべき関係は何か versus 実際に支配的となったものは何か」という単一の問いの下で多様な故障モードを説明している。 実用的な示唆として、エージェントアーキテクチャは生成と権威を区別し、意図した階層構造が崩壊した際に軌道を制限または終了させるメカニズムが存在することを確保する必要がある。