शोधकर्ताओं ने TokenProbe प्रस्तुत किया, एक फ्रेमवर्क जो अनुक्रम के भीतर टोकन के असमान मूल्य का लाभ उठाकर चेन-ऑफ़-थॉट (Chain-of-Thought) तर्क में उच्च टोकन खपत को संबोधित करता है। विधि संरचनात्मक टोकन और अनावश्यक फिलर के बीच अंतर करने के लिए सामान्यीकृत लॉग प्रायिकता का उपयोग करती है, जिससे चयनात्मक संपीड़न संभव होता है।
- TokenProbe लॉग प्रायिकता सिग्नल का उपयोग करके निर्णायक तर्क सामग्री वहन करने वाले केंद्रीय टोकन और कम-विश्वास वाली अन्वेषणात्मक फिलर की पहचान करता है।
- यह सटीकता-टोकन दक्षता के संतुलन को बेहतर बनाने के लिए अनावश्यक टोकन का चयनात्मक रूप से संपीड़न करने वाला एक कुशल GRPO उद्देश्य पेश करता है।
- आधार रेखा की तुलना में तर्क की गुणवत्ता बनाए रखते हुए यह टोकन उपयोग को 76% तक कम कर देता है।
- मेल खाते तर्क-लक्षित बजट के तहत, TokenProbe जैसे शक्तिशाली फ्लैगशिप आधार रेखाओं जैसे Gemini-3.1-Pro से बेहतर प्रदर्शन करता है।
यह कार्य दिखाता है कि कम-मूल्य वाले टोकन का संपीड़न पैरेटो सुधार देता है, जिससे प्रदर्शन को त्यागे बिना कुशल तर्क संभव होता है।