Um estudo caracteriza os "FragileTokens", entradas do vocabulário em modelos de linguagem de peso aberto que copiam com sucesso quando isolados, mas exibem erros quando inseridos no texto circundante. A pesquisa destaca que a preservação literal da identidade não é garantida por testes de isolamento padrão, pois tokens podem ser excluídos, substituídos ou truncados dentro de sequências.
- Testados oito modelos de peso aberto das famílias Qwen e OLMo usando IDs de token fixos inseridos em sequências aleatórias de palavras comuns de comprimentos variados.
- Descobriu-se que uma triagem baseada em probabilidade sinaliza de 0,4% a 10,9% dos tokens que passaram no isolamento como suscetíveis em pelo menos 10% dos contextos testados.
- Demonstraram modos específicos de falha, incluindo exclusão, substituição, truncamento e tradução, com alguns erros ocorrendo mesmo sob distribuições de saída concentradas.
- Avaliaram sinais geométricos, descobrindo que a proximidade entre embeddings de entrada e saída alcançou uma AUROC de 0,744 a 0,881 em sete modelos para identificar esses tokens.
- Mostrou que candidatos frágeis selecionados são preservados com menos frequência do que controles estáveis em tarefas de instrução e uso simulado de ferramentas.
Os achados motivam o uso de protocolos de verificação contextual, argumentando que passar em um teste de isolamento não deve ser tratado como um certificado geral de confiabilidade literal.