قام باحثو ByteLex ببناء فضاء إحداثيات من 11 مفردات للمُرمِّز للتنبؤ بالكلمات المصطنعة التي سيفشل فيها نموذج اللغة على مستوى البايت الخاص بهم. حققت الخريطة ارتباط سبيرمان بقيمة -0.98 مع دقة النموذج المقاسة لكل كلمة، متفوقةً على الإحصائيات المستمدة من المجموعة النصية.

  • النموذج هو نموذج لغة على مستوى البايت يحتوي على 237M معلمة، تم تدريبه على UTF-8 الخام دون ترميز.
  • وُجد أن الأخطاء تعتمد بشكل أساسي على البايت الأول، حيث تستحوذ أولويات البايت الإنجليزية على الإجابة.
  • استُخدمت الخريطة لتوليد بيانات تدريب مستهدفة للنقاط الضعيفة المتوقعة.
  • تحسنت دقة البيانات المحجوزة من .53/.40 إلى .84/.79 بعد تطبيق الإصلاح.

يتيح هذا النهج للمطورين تحديد وتصحيح أوضاع الفشل المحددة في النماذج الخالية من المُرمِّز باستخدام التحليل الهيكلي فقط للمُرمِّزات الموجودة.