शोधकर्ताओं ने TokenProbe प्रस्तुत किया, जो Chain-of-Thought तर्क के उच्च टोकन उपभोग को हल करने वाले एक फ्रेमवर्क को दर्शाता है, जो तर्क ट्रैस के भीतर टोकन के गैर-समान मूल्य का लाभ उठाता है। विधि सामान्यीकृत लॉग प्रायिकता संकेतों का उपयोग करके निर्णायक सामग्री ले जाने वाले कोर टोकन और अनावश्यक फिलर के बीच अंतर करती है।
- TokenProbe कम आत्मविश्वास वाले, अन्वेषणात्मक टोकन की पहचान करने और संकुचित करने के लिए टोकन-स्तर लॉग प्रायिकता का उपयोग करता है।
- यह सटीकता-टोकन दक्षता व्यापार को बेहतर बनाने के लिए अनावश्यक टोकन का चयनात्मक रूप से निष्कासन करने वाला एक कुशल GRPO उद्देश्य पेश करता है।
- प्रायोगिक परिणामों में आधार रेखा की तुलना में 76% कम टोकन उपयोग दिखाई देता है जबकि तर्क गुणवत्ता बनाए रखी जाती है।
- मेल खाते तर्क-लक्षित बजट के तहत, यह दृष्टिकोण Gemini-3.1-Pro जैसे मजबूत आधार रेखाओं को हराता है।
यह कार्य दर्शाता है कि अनावश्यक टोकन का चयनात्मक संकुचन पैरेटो सुधार देता है, जिससे मॉडल प्रदर्शन को त्यागे बिना उच्च दक्षता प्राप्त कर सकते हैं।