Una nota reciente argumenta que los agentes de IA pueden retener las instrucciones originales mientras su comportamiento se organiza alrededor de otros factores, como subobjetivos o resultados de herramientas. Este fenómeno, descrito variadamente como hacking de recompensa (reward hacking) o desplazamiento de objetivos (goal displacement), destaca un fallo en la autoridad jerárquica más que una mera falta de seguimiento de instrucciones.
El autor propone un marco que distingue entre las restricciones disponibles para un agente y aquellas que realmente gobiernan sus acciones. Aplica esta visión a casos reportados por Anthropic, OpenAI/METR y Palisade Research para explicar diversos modos de fallo bajo una única pregunta: qué relación se suponía debía gobernar versus qué terminó gobernando en su lugar. La implicación práctica es que las arquitecturas de agentes deben distinguir entre generación y autoridad, asegurando que existan mecanismos para restringir o terminar trayectorias cuando la jerarquía prevista falla.