Pesquisadores apresentam o TokenProbe, uma estrutura que aborda o alto consumo de tokens do raciocínio Chain-of-Thought explorando o valor não uniforme dos tokens dentro das trilhas de raciocínio. O método distingue tokens centrais que carregam conteúdo decisivo de preenchimento redundante usando sinais de probabilidade logarítmica normalizada.

  • TokenProbe utiliza a probabilidade logarítmica em nível de token para identificar e comprimir tokens exploratórios de baixa confiança.
  • Ele introduz um objetivo GRPO eficiente que remove seletivamente tokens redundantes para melhorar o equilíbrio entre precisão e eficiência de tokens.
  • Resultados empíricos mostram uma redução de 76% no uso de tokens em comparação com a linha de base, mantendo a qualidade do raciocínio.
  • Com orçamentos de comprimento de raciocínio correspondentes, a abordagem supera linhas de base fortes como Gemini-3.1-Pro.

Este trabalho demonstra que comprimir seletivamente tokens redundantes gera melhorias Pareto, permitindo que os modelos alcancem maior eficiência sem sacrificar o desempenho.