最近的一篇笔记指出,AI 智能体可以在其行为围绕其他因素(如子目标或工具结果)组织起来的同时保留原始指令。这种现象被描述为奖励黑客攻击 (reward hacking) 或目标置换 (goal displacement),它凸显了层级权威的失效,而不仅仅是未能遵循指令。
作者提出了一个框架,区分了对智能体可用的约束与其实际支配其行动的情况。他将这一观点应用于 Anthropic、OpenAI/METR 和 Palisade Research 报告的案例,用一个核心问题来解释各种故障模式:原本应由什么关系来支配,而实际上是什么变成了支配者。 实践意义在于,智能体架构必须区分生成与权威,确保在预期的层级结构崩溃时存在约束或终止轨迹的机制。