Los investigadores presentan TokenProbe, un marco que aborda el alto consumo de tokens del razonamiento Chain-of-Thought explotando el valor no uniforme de los tokens dentro de las trazas de razonamiento. El método distingue entre tokens centrales que llevan contenido decisivo y relleno redundante utilizando señales de probabilidad logarítmica normalizada.

  • TokenProbe utiliza la probabilidad logarítmica a nivel de token para identificar y comprimir tokens exploratorios de baja confianza.
  • Introduce un objetivo GRPO eficiente que elimina selectivamente tokens redundantes para mejorar el equilibrio entre precisión y eficiencia de tokens.
  • Los resultados empíricos muestran una reducción del 76% en el uso de tokens en comparación con la línea base mientras se mantiene la calidad del razonamiento.
  • Con presupuestos de longitud de razonamiento coincidentes, el enfoque supera a líneas base sólidas como Gemini-3.1-Pro.

Este trabajo demuestra que comprimir selectivamente tokens redundantes produce mejoras Pareto, permitiendo a los modelos lograr una mayor eficiencia sin sacrificar el rendimiento.