연구원들은 Chain-of-Thought 추론의 높은 토큰 소비를 추론 궤적 내 토큰의 비균일한 가치를 활용하여 해결하는 프레임워크인 TokenProbe를 제시했습니다. 이 방법은 정규화된 로그 확률 신호를 사용하여 결정적인 내용을 담고 있는 핵심 토큰과 중복된 필러를 구분합니다.
- TokenProbe는 낮은 신뢰도의 탐색적 토큰을 식별하고 압축하기 위해 토큰 수준의 로그 확률을 사용합니다.
- 정확성과 토큰 효율성 간의 균형을 개선하기 위해 중복 토큰을 선택적으로 제거하는 효율적인 GRPO 목적 함수를 도입합니다.
- 실험 결과, 추론 품질을 유지하면서 기준선 대비 토큰 사용량이 76% 감소했습니다.
- 일치하는 추론 길이 예산 하에서 이 접근 방식은 Gemini-3.1-Pro와 같은 강력한 기준선을 능가합니다.
이 연구는 중복 토큰을 선택적으로 압축하면 파레토 개선 효과를 얻을 수 있음을 보여주며, 성능을 희생하지 않고도 더 높은 효율성을 달성할 수 있음을 입증합니다.