Para peneliti menyajikan TokenProbe, sebuah kerangka kerja yang mengatasi konsumsi token tinggi dari penalaran Chain-of-Thought dengan memanfaatkan nilai token yang tidak seragam dalam suatu urutan. Metode ini menggunakan probabilitas logaritmik ternormalisasi untuk membedakan token struktural inti dari pengisi redundan, memungkinkan kompresi selektif.
- TokenProbe mengidentifikasi token inti yang membawa konten penalaran penting versus pengisi eksplorasi kepercayaan rendah menggunakan sinyal probabilitas logaritmik.
- Metode ini memperkenalkan tujuan GRPO efisien yang secara selektif mengompresi token redundan untuk meningkatkan trade-off akurasi-efisiensi token.
- Pendekatan ini mengurangi penggunaan token sebesar 76% dibandingkan dengan baseline sambil mempertahankan kualitas penalaran.
- Dengan anggaran panjang penalaran yang cocok, TokenProbe unggul dibandingkan baseline unggulan kuat seperti Gemini-3.1-Pro.
Karya ini menunjukkan bahwa mengompresi token bernilai rendah menghasilkan perbaikan Pareto, memungkinkan penalaran efisien tanpa mengorbankan kinerja.