Peneliti menyajikan TokenProbe, sebuah kerangka kerja yang mengatasi konsumsi token tinggi dari penalaran Chain-of-Thought dengan memanfaatkan nilai tidak seragam dari token di dalam jejak penalaran. Metode ini membedakan token inti yang membawa konten penting dari pengisi redundan menggunakan sinyal probabilitas logaritmik ternormalisasi.

  • TokenProbe memanfaatkan probabilitas logaritmik tingkat token untuk mengidentifikasi dan mengompresi token eksplorasi dengan kepercayaan rendah.
  • Metode ini memperkenalkan tujuan GRPO yang efisien yang secara selektifs menghapus token redundan untuk meningkatkan trade-off antara akurasi dan efisiensi token.
  • Hasil empiris menunjukkan pengurangan penggunaan token sebesar 76% dibandingkan dengan baseline sambil mempertahankan kualitas penalaran.
  • Dengan anggaran panjang penalaran yang cocok, pendekatan ini mengunggoli baseline kuat seperti Gemini-3.1-Pro.

Karya ini menunjukkan bahwa mengompresi token redundan secara selektif menghasilkan perbaikan Pareto, memungkinkan model mencapai efisiensi lebih tinggi tanpa mengorbankan kinerja.