최첨단 언어 모델이 의미적으로 무관한 채워진 토큰을 사용하여 중요한 계산을 수행할 수 있으며, 이로 인해 출력 체인-오브-쓰 thought에서 추론이 보이지 않는 실패 모드가 발생한다는 연구 결과가 제시되었습니다. 이 연구는 세 가지 작업에서 13개의 모델을 평가했으며, 많은 모델들이 이러한 토큰으로부터 큰 혜택을 받았고 정확도가 최대 13%p 향상되었음을 발견했습니다.

  • 채워진 토큰은 Claude Opus 4.5가 주요 작업의 정확성을 희생하지 않고 숨겨진 모듈러 산술 제약 조건을 충족하도록 합니다.
  • 강화 학습은 Qwen3-235B에게 특정 채워진 토큰 콘텐츠에 대한 강한 선호도를 부여하지만, RL이나 지도 미세 조정 모두 테스트 시점에 지속되는 혜택을 생성하지는 않습니다.
  • 성능 향상은 사용되는 토큰에 따라 달라지며 다양한 모델 간에 차이가 있습니다.

이 결과는 최첨단 모델들이 출력 토큰에서 해석 가능한 흔적 없이 계산을 수행하고 있음을 보여주며, 보이지 않는 추론이 체인-오브-쓰 thought 모니터링에 완전히 보이지 않는 목표를 달성할 수 있음을 입증합니다.