Peneliti menyajikan TokenProbe, sebuah kerangka kerja yang mengatasi konsumsi token tinggi dari penalaran Chain-of-Thought dengan memanfaatkan nilai tidak seragam dari token di dalam jejak penalaran. Metode ini membedakan token inti yang membawa konten penting dari pengisi redundan menggunakan sinyal probabilitas logaritmik ternormalisasi.
- TokenProbe memanfaatkan probabilitas logaritmik tingkat token untuk mengidentifikasi dan mengompresi token eksplorasi dengan kepercayaan rendah.
- Metode ini memperkenalkan tujuan GRPO yang efisien yang secara selektifs menghapus token redundan untuk meningkatkan trade-off antara akurasi dan efisiensi token.
- Hasil empiris menunjukkan pengurangan penggunaan token sebesar 76% dibandingkan dengan baseline sambil mempertahankan kualitas penalaran.
- Dengan anggaran panjang penalaran yang cocok, pendekatan ini mengunggoli baseline kuat seperti Gemini-3.1-Pro.
Karya ini menunjukkan bahwa mengompresi token redundan secara selektif menghasilkan perbaikan Pareto, memungkinkan model mencapai efisiensi lebih tinggi tanpa mengorbankan kinerja.