Pesquisadores apresentam o TokenProbe, uma estrutura que aborda o alto consumo de tokens do raciocínio em cadeia (Chain-of-Thought) explorando o valor não uniforme dos tokens dentro de uma sequência. O método usa probabilidade logarítmica normalizada para distinguir tokens estruturais centrais de preenchimento redundante, permitindo compressão seletiva.
- O TokenProbe identifica tokens centrais que carregam conteúdo decisivo de raciocínio versus preenchimento exploratório de baixa confiança usando sinais de probabilidade logarítmica.
- Ele introduz um objetivo GRPO eficiente que comprime seletivamente tokens redundantes para melhorar a relação entre precisão e eficiência de tokens.
- A abordagem reduz o uso de tokens em 76% em comparação com a linha de base, mantendo a qualidade do raciocínio.
- Com orçamentos de comprimento de raciocínio correspondentes, o TokenProbe supera linhas de base fortes como Gemini-3.1-Pro.
Este trabalho demonstra que comprimir tokens de baixo valor gera melhorias de Pareto, permitindo raciocínio eficiente sem sacrificar o desempenho.