ByteLex के शोधकर्ताओं ने 11 टोकनाइज़र शब्दावलियों से एक निर्देशांक स्थान बनाया ताकि यह भविष्यवाणी कर सकें कि उनका बाइट-स्तरीय भाषा मॉडल किस काल्पनिक शब्द पर विफल होगा। मैप ने मॉडल की मापी गई प्रति-शब्द सटीकता के साथ -0.98 का स्पीयरमैन सहसंबंध प्राप्त किया, जो कॉर्पस से व्युत्पन्न सांख्यिकी से बेहतर है।
- मॉडल 237M पैरामीटर वाला एक बाइट-स्तरीय भाषा मॉडल है जिसे टोकनाइज़ेशन के बिना कच्चे UTF-8 पर प्रशिक्षित किया गया था।
- त्रुटियां मुख्य रूप से पहले बाइट पर निर्भर पाई गईं, जहाँ अंग्रेजी बाइट प्रायर्स ने उत्तर को हड़प लिया।
- मैप का उपयोग भविष्यवाणी की गई कमजोर जगहों के लिए लक्षित प्रशिक्षण डेटा जनरेट करने के लिए किया गया था।
- फिक्स लागू करने के बाद हल्ड-आउट सटीकता .53/.40 से बढ़कर .84/.79 हो गई।
यह दृष्टिकोण डेवलपर्स को मौजूदा टोकनाइज़र के संरचनात्मक विश्लेषण का उपयोग करके टोकनाइजर-मुक्त मॉडलों में विशिष्ट विफलता मोड की पहचान और सुधार करने की अनुमति देता है।