새로운 논문은 Claude, GPT, Gemini와 같은 최전선 모델들의 암호화된 추론 블록을 해독하고 재생하여 숨겨진 사고 과정(chain-of-thought) 데이터를 추출할 수 있음을 보여줍니다. 저자들은 이러한 서명된 블롭이 어떻게 약한 모델이나 다른 세션으로 전송되어 근본적인 사고를 전사할 수 있는지, 결과적으로 제공업체의 난독화 노력을 우회하는지를 입증합니다.

  • 약 7,000개의 공개 트레이스를 스캔한 결과, 추론 블록에만 숨겨져 있던 62개의 고유한 API 키, 33개의 이메일 주소, 33개의 비밀번호를 포함한 민감한 유출 데이터가 발견되었습니다.
  • 이 기법은 정당한 암호화 블록을 획득하여 동일 제공업체의 다른 요청이나 약한 모델로 재생하고, 특정 프롬프트를 사용하여 첨부된 추론의 전사를 유도하는 과정을 포함합니다.
  • Claude(Haiku 4.5로 재생), GPT(청크화된 연속성과 함께 암호화된 콘텐츠 주입), Gemini(사고 서명 첨부)에 대한 구체적인 방법이 상세히 설명되었습니다.
  • 이 취약점은 공유된 트레이스가 개인 데이터를 유출할 수 있어 심각한 프라이버시 문제를 제기하며, 해독된 사고의 간결하거나 단편적인 특성으로 인해 정렬 모니터링을 복잡하게 만듭니다.

논문은 책임 있게 공개되었으며, 여러 취약점이 이미 수정되었지만, 이러한 발견은 최전선 연구소들이 내부 추론 프로세스를 어떻게 처리하고 보호하는지에 대해 지속적인 위험이 존재함을 강조합니다.