Los investigadores presentan TokenProbe, un marco que aborda el alto consumo de tokens del razonamiento en cadena (Chain-of-Thought) aprovechando el valor no uniforme de los tokens dentro de una secuencia. El método utiliza la probabilidad logarítmica normalizada para distinguir los tokens estructurales centrales del relleno redundante, permitiendo una compresión selectiva.
- TokenProbe identifica los tokens centrales que llevan contenido de razonamiento decisivo frente al relleno exploratorio de baja confianza utilizando señales de probabilidad logarítmica.
- Introduce un objetivo GRPO eficiente que comprime selectivamente los tokens redundantes para mejorar el equilibrio entre precisión y eficiencia de tokens.
- El enfoque reduce el uso de tokens en un 76% en comparación con la línea base mientras mantiene la calidad del razonamiento.
- Con presupuestos de longitud de razonamiento coincidentes, TokenProbe supera a líneas base insignia fuertes como Gemini-3.1-Pro.
Este trabajo demuestra que comprimir tokens de bajo valor produce mejoras de Pareto, permitiendo un razonamiento eficiente sin sacrificar el rendimiento.