Les chercheurs présentent TokenProbe, un cadre qui traite la forte consommation de tokens du raisonnement Chain-of-Thought en exploitant la valeur non uniforme des tokens au sein des traces de raisonnement. La méthode distingue les tokens centraux portant le contenu décisif des remplissages redondants à l'aide de signaux de probabilité logarithmique normalisée.

  • TokenProbe utilise la probabilité logarithmique au niveau du token pour identifier et compresser les tokens exploratoires peu confiants.
  • Il introduit un objectif GRPO efficace qui supprime sélectivement les tokens redondants pour améliorer le compromis entre précision et efficacité des tokens.
  • Les résultats empiriques montrent une réduction de 76 % de l'utilisation des tokens par rapport à la ligne de base tout en maintenant la qualité du raisonnement.
  • Avec des budgets de longueur de raisonnement correspondants, l'approche surpasse des lignes de base solides telles que Gemini-3.1-Pro.

Ce travail démontre que la compression sélective des tokens redondants produit des améliorations Pareto, permettant aux modèles d'atteindre une efficacité plus élevée sans sacrifier les performances.