يقدم الباحثون إطار عمل TokenProbe الذي يعالج استهلاك الرموز العالي في استدلال سلسلة التفكير (Chain-of-Thought) من خلال الاستفادة من القيمة غير المتجانسة للرموز داخل تسلسل. تستخدم الطريقة الاحتمال اللوغاريتمي المعياري لتمييز الرموز الهيكلية الأساسية عن الحشو الزائد، مما يسمح بالضغط الانتقائي.

  • يحدد TokenProbe الرموز الأساسية التي تحمل محتوى استدلال حاسماً مقابل الحشو الاستكشاعي منخفض الثقة باستخدام إشارات الاحتمال اللوغاريتمي.
  • يقدم هدفاً فعالاً لـ GRPO يقوم بالضغط الانتقائي للرموز الزائدة لتحسين المقايضة بين الدقة وكفاءة الرموز.
  • يقلل النهج من استخدام الرموز بنسبة 76% مقارنة بخط الأساس مع الحفاظ على جودة الاستدلال.
  • تحت ميزانيات طول استدلال متطابقة، يتفوق TokenProbe على خطوط الأساس القوية مثل Gemini-3.1-Pro.

تُظهر هذه الدراسة أن ضغط الرموز منخفضة القيمة يحقق تحسينات باريتو، مما يتيح استدلالاً فعالاً دون التضحية بالأداء.