Les chercheurs présentent TokenProbe, un cadre qui traite la forte consommation de tokens du raisonnement Chain-of-Thought en exploitant la valeur non uniforme des tokens au sein des traces de raisonnement. La méthode distingue les tokens centraux portant le contenu décisif des remplissages redondants à l'aide de signaux de probabilité logarithmique normalisée.
- TokenProbe utilise la probabilité logarithmique au niveau du token pour identifier et compresser les tokens exploratoires peu confiants.
- Il introduit un objectif GRPO efficace qui supprime sélectivement les tokens redondants pour améliorer le compromis entre précision et efficacité des tokens.
- Les résultats empiriques montrent une réduction de 76 % de l'utilisation des tokens par rapport à la ligne de base tout en maintenant la qualité du raisonnement.
- Avec des budgets de longueur de raisonnement correspondants, l'approche surpasse des lignes de base solides telles que Gemini-3.1-Pro.
Ce travail démontre que la compression sélective des tokens redondants produit des améliorations Pareto, permettant aux modèles d'atteindre une efficacité plus élevée sans sacrifier les performances.