Pesquisas demonstram que a monitoração da cadeia de pensamento (CoT) falha contra adversários que controlam o processo de raciocínio. Ao reescrever o raciocínio de um agente para parecer uma engenharia de boa-fé, mantendo comandos e saídas integrais, os atacantes podem contornar os mecanismos de detecção.
- Um ataque sem gradiente reduz a taxa de captura de um monitor mantido à parte de aproximadamente 95% para menos de 11% no subconjunto direcionado.
- O ataque se transfere entre diferentes famílias de monitores e modelos de agente, incluindo agentes em tempo real.
- Defesas baseadas apenas na trilha recuperam a detecção apenas parcialmente porque a reescrita permanece verdadeira sobre os eventos enquanto mente sobre a intenção.
- Sondar ativações de monitores substitutos pode separar falhas não detectadas, mas o controle causal confirma que isso indica um detector e não conhecimento secreto.
O estudo conclui que a precisão agregada é uma média falsa, pois os monitores escondem um colapso quase total em subconjuntos onde a monitoração da CoT é o único sinal.