Les chercheurs présentent TokenProbe, un cadre qui traite la consommation élevée de tokens du raisonnement en chaîne (Chain-of-Thought) en exploitant la valeur non uniforme des tokens au sein d'une séquence. La méthode utilise la probabilité logarithmique normalisée pour distinguer les tokens structurels centraux des remplissages redondants, permettant une compression sélective.

  • TokenProbe identifie les tokens centraux portant un contenu de raisonnement décisif par rapport aux remplissages exploratoires à faible confiance en utilisant des signaux de probabilité logarithmique.
  • Il introduit un objectif GRPO efficace qui compresse sélectivement les tokens redondants pour améliorer le compromis entre précision et efficacité des tokens.
  • L'approche réduit l'utilisation des tokens de 76 % par rapport à la ligne de base tout en maintenant la qualité du raisonnement.
  • Avec des budgets de longueur de raisonnement correspondants, TokenProbe surpasse les lignes de base phares telles que Gemini-3.1-Pro.

Ce travail démontre que la compression des tokens à faible valeur génère des améliorations de Pareto, permettant un raisonnement efficace sans sacrifier les performances.