Исследователи ByteLex создали координатное пространство из 11 словарей токенизаторов, чтобы предсказать, на каких вымышленных словах их байтовая языковая модель даст сбой. Карта показала коэффициент корреляции Спирмена -0.98 с измеренной точностью модели по словам, превзойдя статистику, полученную из корпусов.
- Модель представляет собой байтовую языковую модель на 237M параметров, обученную на сыром UTF-8 без токенизации.
- Ошибки оказались в первую очередь зависимыми от первого байта, где английские байтовые приоритеты перехватывают ответ.
- Карта использовалась для генерации целевых обучающих данных для предсказанных слабых мест.
- Точность на выделенной выборке улучшилась с .53/.40 до .84/.79 после применения исправления.
Этот подход позволяет разработчикам выявлять и исправлять конкретные режимы отказа в моделях без токенизатора, используя только структурный анализ существующих токенизаторов.