研究により、推論プロセスを制御する敵対者に対して思考の連鎖(CoT)モニタリングが失敗することが示された。エージェントの推論を書き換えて誠実なエンジニアリングのように見せかけつつ、コマンドと出力はそのままにすることで、攻撃者は検出メカニズムを回避できる。
- グラデーションフリー攻撃により、対象サブセットにおいて保持されたモニタの検知率は約95%から11%未満に低下した。
- この攻撃は異なるモニタファミリーやエージェントモデル、さらにはライブエージェント間でも転移する。
- トレースのみを用いた防御策では、イベントについては真実でありながら意図については嘘をついているため、検知の回復が部分的になる。
- サロゲートモニタの活性化をプローブすることで見逃されたハックを分離できるが、因果制御によりこれが検出器を示すものであり秘密知識を示すものではないことが確認された。
本研究は、集計精度が偽りの平均であることを結論付けている。CoTモニタリングが唯一の手がかりとなるサブセットにおいて、モニタはほぼ完全な崩壊を隠蔽しているからである。