Pesquisadores do ByteLex construíram um espaço de coordenadas a partir de 11 vocabulários de tokenizadores para prever em quais palavras inventadas seu modelo de linguagem em nível de byte falharia. O mapa alcançou uma correlação de Spearman de -0.98 com a precisão por palavra medida do modelo, superando estatísticas derivadas de corpus.

  • O modelo é um modelo de linguagem em nível de bytes de 237M parâmetros treinado em UTF-8 bruto sem tokenização.
  • Os erros foram encontrados para depender principalmente do primeiro byte, onde as priors de bytes em inglês sequestram a resposta.
  • O mapa foi usado para gerar dados de treinamento direcionados para os pontos fracos previstos.
  • A precisão em dados não vistos melhorou de .53/.40 para .84/.79 após aplicar a correção.

Esta abordagem permite que desenvolvedores identifiquem e corrijam modos de falha específicos em modelos sem tokenizador usando apenas análise estrutural dos tokenizadores existentes.