연구자들은 체인-오브-스루트(Chain-of-Thought) 추론의 높은 토큰 소비를 시퀀스 내 토큰의 비균일한 가치를 활용하여 해결하는 프레임워크 TokenProbe를 제시했습니다. 이 방법은 정규화된 로그 확률을 사용하여 핵심 구조적 토큰과 중복된 필러를 구별함으로써 선택적 압축을 가능하게 합니다.

  • TokenProbe는 로그 확률 신호를 사용하여 결정적인 추론 내용을 담고 있는 핵심 토큰과 낮은 신뢰도의 탐색적 필러를 식별합니다.
  • 이는 정확성과 토큰 효율성 간의 균형을 개선하기 위해 중복된 토큰을 선택적으로 압축하는 효율적인 GRPO 목적 함수를 도입합니다.
  • 이 접근 방식은 추론 품질을 유지하면서 기준선 대비 토큰 사용량을 76% 줄입니다.
  • 일치하는 추론 길이 예산 하에서 TokenProbe는 Gemini-3.1-Pro와 같은 강력한 플래그십 기준선을 능가합니다.

이 연구는 낮은 가치의 토큰을 압축하는 것이 파레토 개선을 가져와 성능을 희생하지 않고도 효율적인 추론을 가능하게 함을 보여줍니다.