शोधकर्ताओं ने बड़े भाषा मॉडल में टोकनाइज़ेशन को बढ़ाने के लिए शब्दावली निर्माण के लिए काउंटिंग एंड फिल्टरिंग (CNF) और टेक्स्ट सेगमेंटेशन के लिए मिन-कोस्ट एन्कोडिंग (MCE) का प्रस्ताव रखा है। यह संयोजन बाइट पेयर एन्कोडिंग (BPE) की तुलना में उच्च टोकन दक्षता, अधिक स्केलेबिलिटी और कम निर्भरता प्रदान करता है।
- CNF वैध सबस्ट्रिंग्स को गिनकर एक कच्ची शब्दावली बनाता है और MCE सेगमेंटेशन के दौरान वास्तविक उपयोग के आधार पर इसे फ़िल्टर करता है।
- MCE विलीन सूचियों या टोकन प्रायिकताओं पर निर्भर किए बिना इष्टतम वैश्विक सेगमेंटेशन निर्धारित करने के लिए टेक्स्ट सेगमेंट्स पर एक लागत फलन को न्यूनतम करता है।
- 250K शब्दावली के साथ, CNF-MCE अंग्रेजी वेब टेक्स्ट पर o200k_base और qwen250k टोकनाइज़र की तुलना में संपीड़न दर को 26% और 30% बढ़ाता है।
- शब्दावली को 1M एंट्री तक स्केल करने से टोकन दक्षता में 60% से अधिक सुधार होता है और शब्दावली उपयोगिता 52.9% से बढ़कर 96.9% हो जाती है।
- 1.8B और 8B पैमाने पर प्रशिक्षित भाषा मॉडल 11 बेंचमार्क्स में BPE-आधारित मॉडल के समान प्रदर्शन प्राप्त करते हैं।
परिणाम दर्शाते हैं कि CNF-MCE टोकन दक्षता को महत्वपूर्ण रूप से बढ़ाता है और प्रतिस्पर्धी डाउनस्ट्रीम प्रदर्शन बनाए रखता है, जो विभिन्न विधियों से निर्मित शब्दावली पर लागू होता है।