Исследователи ByteLex создали координатное пространство из 11 словарей токенизаторов, чтобы предсказать, на каких вымышленных словах их байтовая языковая модель даст сбой. Карта показала коэффициент корреляции Спирмена -0.98 с измеренной точностью модели по словам, превзойдя статистику, полученную из корпусов.

  • Модель представляет собой байтовую языковую модель на 237M параметров, обученную на сыром UTF-8 без токенизации.
  • Ошибки оказались в первую очередь зависимыми от первого байта, где английские байтовые приоритеты перехватывают ответ.
  • Карта использовалась для генерации целевых обучающих данных для предсказанных слабых мест.
  • Точность на выделенной выборке улучшилась с .53/.40 до .84/.79 после применения исправления.

Этот подход позволяет разработчикам выявлять и исправлять конкретные режимы отказа в моделях без токенизатора, используя только структурный анализ существующих токенизаторов.