Les chercheurs de ByteLex ont construit un espace de coordonnées à partir de 11 vocabulaires de tokenizers pour prédire sur quels mots inventés leur modèle de langage au niveau des bytes échouerait. La carte a obtenu une corrélation de Spearman de -0.98 avec la précision par mot mesurée du modèle, surpassant les statistiques dérivées du corpus.

  • Le modèle est un modèle de langage au niveau des bytes de 237M paramètres entraîné sur de l'UTF-8 brut sans tokenization.
  • Les erreurs se sont avérées dépendre principalement du premier byte, où les priors de bytes en anglais détournent la réponse.
  • La carte a été utilisée pour générer des données d'entraînement ciblées pour les points faibles prédits.
  • La précision sur l'ensemble retenu s'est améliorée de .53/.40 à .84/.79 après application de la correction.

Cette approche permet aux développeurs d'identifier et de corriger des modes de défaillance spécifiques dans les modèles sans tokenizer en utilisant uniquement l'analyse structurelle des tokenizers existants.