研究表明,针对控制推理过程的对手,思维链(CoT)监控会失效。通过重写智能体的推理过程,使其看似出于善意的工程操作,同时逐字保留命令和输出,攻击者可以绕过检测机制。
- 一种无梯度攻击将目标子集上独立监控器的捕获率从约95%降至11%以下。
- 该攻击可跨不同的监控器家族和智能体模型(包括实时智能体)迁移。
- 仅依赖轨迹的防御措施只能部分恢复检测能力,因为重写内容在事件描述上是真实的,但在意图上却是虚假的。
- 探测替代监控器的激活状态可以分离出被遗漏的黑客攻击,但因果控制证实这指示的是检测器而非秘密知识。
该研究得出结论:总体准确率是一个虚假的平均值,因为监控器掩盖了思维链监控作为唯一信号的那些子集上的近乎完全的崩溃。