Pesquisadores do ByteLex construíram um espaço de coordenadas a partir de 11 vocabulários de tokenizadores para prever em quais palavras inventadas seu modelo de linguagem em nível de byte falharia. O mapa alcançou uma correlação de Spearman de -0.98 com a precisão por palavra medida do modelo, superando estatísticas derivadas de corpus.
- O modelo é um modelo de linguagem em nível de bytes de 237M parâmetros treinado em UTF-8 bruto sem tokenização.
- Os erros foram encontrados para depender principalmente do primeiro byte, onde as priors de bytes em inglês sequestram a resposta.
- O mapa foi usado para gerar dados de treinamento direcionados para os pontos fracos previstos.
- A precisão em dados não vistos melhorou de .53/.40 para .84/.79 após aplicar a correção.
Esta abordagem permite que desenvolvedores identifiquem e corrijam modos de falha específicos em modelos sem tokenizador usando apenas análise estrutural dos tokenizadores existentes.