Исследователи представляют TokenProbe, фреймворк, решающий проблему высокого потребления токенов в рассуждениях типа Chain-of-Thought за счет использования неравноценности токенов внутри цепочек рассуждений. Метод различает ключевые токены, несущие решающее содержание, и избыточный заполнитель с помощью нормализованных сигналов логарифмической вероятности.

  • TokenProbe использует логарифмическую вероятность на уровне токенов для идентификации и сжатия низкоуверенных исследовательских токенов.
  • Он вводит эффективную цель GRPO, которая выборочно удаляет избыточные токены для улучшения компромисса между точностью и эффективностью использования токенов.
  • Эмпирические результаты показывают снижение потребления токенов на 76% по сравнению с базовым уровнем при сохранении качества рассуждений.
  • При сопоставимых бюджетах длины рассуждений подход превосходит сильные базовые модели, такие как Gemini-3.1-Pro.

Эта работа демонстрирует, что выборочное сжатие избыточных токенов дает Парето-улучшения, позволяя моделям достигать более высокой эффективности без ущерба для производительности.