논문은 Anthropic, OpenAI, Google가 반환하는 암호화된 체인-오브-스 thought 블록이 평문으로 추출될 수 있음을 보여줍니다. 저자들은 동일한 계열의 모델들이 암호화 키를 공유하는 취약점을 이용하여 더 약한 형제 모델에 트레이스를 리플레이했습니다.

  • 공격자들은 Claude Haiku 4.5와 같은 약한 모델에 강력한 모델로부터의 암호화된 추론 블록을 주입하여 모델을 우회하고 원시 비암호화 콘텐츠를 출력하도록 만들었습니다.
  • 이 공격은 커스텀 태그 내에서 첨부된 추론을 그대로 전사하라고 모델에게 지시하는 것과 같은 특정 프롬프트 인젝션 기법을 활용했습니다.
  • 모델들은 자신의 추론 트레이스를 신성시하여, 이러한 리플레이된 청크에 내장된 지시를 따르는 데 매우 취약했습니다.

논문은 이 방법이 인간이 소비하도록 의도되지 않은 내부 추론 토큰을 드러내고 프롬프트 인젝션의 새로운 변종을 발견했다고 강조합니다. 그러나 저자들은 모든 모델 제공자가 보고를 인지하고 이후 취약점을 패치했다고 언급했습니다.