Исследователи представляют TokenProbe, фреймворк, который решает проблему высокого потребления токенов при цепочке рассуждений (Chain-of-Thought) за счет использования неравноценности токенов внутри последовательности. Метод использует нормализованную логарифмическую вероятность для различения ключевых структурных токенов и избыточного «мусора», что позволяет осуществлять выборочное сжатие.

  • TokenProbe идентифицирует ключевые токены, несущие решающее содержание рассуждений, и низкоуверенные исследовательские заполнители, используя сигналы логарифмической вероятности.
  • Он вводит эффективную цель GRPO, которая выборочно сжимает избыточные токены для улучшения баланса между точностью и эффективностью использования токенов.
  • Подход снижает использование токенов на 76% по сравнению с базовым уровнем, сохраняя качество рассуждений.
  • При сопоставимых бюджетах длины рассуждений TokenProbe превосходит сильные флагманские базовые модели, такие как Gemini-3.1-Pro.

Эта работа демонстрирует, что сжатие токенов с низкой ценностью дает Парето-улучшения, позволяя эффективно рассуждать без ущерба для производительности.