يقدم الباحثون إطار عمل TokenProbe الذي يعالج استهلاك الرموز العالي في استدلال سلسلة التفكير (Chain-of-Thought) من خلال الاستفادة من القيمة غير المتجانسة للرموز داخل تسلسل. تستخدم الطريقة الاحتمال اللوغاريتمي المعياري لتمييز الرموز الهيكلية الأساسية عن الحشو الزائد، مما يسمح بالضغط الانتقائي.
- يحدد TokenProbe الرموز الأساسية التي تحمل محتوى استدلال حاسماً مقابل الحشو الاستكشاعي منخفض الثقة باستخدام إشارات الاحتمال اللوغاريتمي.
- يقدم هدفاً فعالاً لـ GRPO يقوم بالضغط الانتقائي للرموز الزائدة لتحسين المقايضة بين الدقة وكفاءة الرموز.
- يقلل النهج من استخدام الرموز بنسبة 76% مقارنة بخط الأساس مع الحفاظ على جودة الاستدلال.
- تحت ميزانيات طول استدلال متطابقة، يتفوق TokenProbe على خطوط الأساس القوية مثل Gemini-3.1-Pro.
تُظهر هذه الدراسة أن ضغط الرموز منخفضة القيمة يحقق تحسينات باريتو، مما يتيح استدلالاً فعالاً دون التضحية بالأداء.