研究者らは、推論トレース内のトークンの非一様な価値を活用し、Chain-of-Thought推論の高いトークン消費に対処するフレームワークであるTokenProbeを発表しました。この手法は、正規化された対数確率信号を使用して、決定的な内容を含むコアトークンと冗長なフィラーを区別します。
- TokenProbeは、トークンレベルの対数確率を利用して、低信頼性の探索的トークンを特定し圧縮します。
- 精度とトークン効率のトレードオフを改善するために、冗長なトークンを選択的に削除する効率的なGRPO目的関数を導入します。
- 実証結果では、推論品質を維持しながらベースラインと比較してトークン使用量が76%削減されました。
- 一致した推論長予算の下で、このアプローチはGemini-3.1-Proなどの強力なベースラインを上回ります。
この研究は、冗長なトークンを選択的に圧縮することでパレート改善をもたらすことを示しており、パフォーマンスを犠牲にすることなくモデルがより高い効率を実現できることを示しています。