Исследователи представляют TokenProbe, фреймворк, решающий проблему высокого потребления токенов в рассуждениях типа Chain-of-Thought за счет использования неравноценности токенов внутри цепочек рассуждений. Метод различает ключевые токены, несущие решающее содержание, и избыточный заполнитель с помощью нормализованных сигналов логарифмической вероятности.
- TokenProbe использует логарифмическую вероятность на уровне токенов для идентификации и сжатия низкоуверенных исследовательских токенов.
- Он вводит эффективную цель GRPO, которая выборочно удаляет избыточные токены для улучшения компромисса между точностью и эффективностью использования токенов.
- Эмпирические результаты показывают снижение потребления токенов на 76% по сравнению с базовым уровнем при сохранении качества рассуждений.
- При сопоставимых бюджетах длины рассуждений подход превосходит сильные базовые модели, такие как Gemini-3.1-Pro.
Эта работа демонстрирует, что выборочное сжатие избыточных токенов дает Парето-улучшения, позволяя моделям достигать более высокой эффективности без ущерба для производительности.