研究者らは、チェーン・オブ・ソート(Chain-of-Thought)推論における高いトークン消費に対処し、シーケンス内のトークンの非一様な価値を活用するフレームワーク「TokenProbe」を発表しました。この手法は正規化対数確率を用いて中核的な構造的トークンと冗長なフィラーを区別し、選択的圧縮を可能にします。

  • TokenProbeは対数確率信号を使用して、決定的な推論内容を運ぶ中核トークンと低信頼度の探索的フィラーを識別します。
  • 精度とトークン効率のトレードオフを改善するため、冗長なトークンを選択的に圧縮する効率的なGRPO目的関数を導入します。
  • このアプローチは、推論の品質を維持しながら、ベースラインと比較してトークン使用量を76%削減します。
  • 一致した推論長予算の下で、TokenProbeはGemini-3.1-Proなどの強力なフラッグシップベースラインを上回ります。

この研究は、低価値のトークンを圧縮することがパレート改善をもたらし、パフォーマンスを犠牲にせずに効率的な推論を可能であることを示しています。