قام باحثو ByteLex ببناء فضاء إحداثيات من 11 مفردات للمُرمِّز للتنبؤ بالكلمات المصطنعة التي سيفشل فيها نموذج اللغة على مستوى البايت الخاص بهم. حققت الخريطة ارتباط سبيرمان بقيمة -0.98 مع دقة النموذج المقاسة لكل كلمة، متفوقةً على الإحصائيات المستمدة من المجموعة النصية.
- النموذج هو نموذج لغة على مستوى البايت يحتوي على 237M معلمة، تم تدريبه على UTF-8 الخام دون ترميز.
- وُجد أن الأخطاء تعتمد بشكل أساسي على البايت الأول، حيث تستحوذ أولويات البايت الإنجليزية على الإجابة.
- استُخدمت الخريطة لتوليد بيانات تدريب مستهدفة للنقاط الضعيفة المتوقعة.
- تحسنت دقة البيانات المحجوزة من .53/.40 إلى .84/.79 بعد تطبيق الإصلاح.
يتيح هذا النهج للمطورين تحديد وتصحيح أوضاع الفشل المحددة في النماذج الخالية من المُرمِّز باستخدام التحليل الهيكلي فقط للمُرمِّزات الموجودة.