Un estudio caracteriza los "FragileTokens", entradas del vocabulario en modelos de lenguaje de peso abierto que copian con éxito cuando están aisladas, pero presentan errores cuando se insertan en el texto circundante. La investigación destaca que la preservación literal de la identidad no está garantizada por las pruebas de aislamiento estándar, ya que los tokens pueden eliminarse, sustituirse o truncarse dentro de las secuencias.
- Se probaron ocho modelos de peso abierto de las familias Qwen y OLMo utilizando IDs de token fijos insertados en secuencias aleatorias de palabras comunes de longitudes variables.
- Se encontró que una pantalla basada en probabilidades marca del 0,4 % al 10,9 % de los tokens que superan el aislamiento como susceptibles en al menos el 10 % de los contextos probados.
- Se demostraron modos específicos de fallo, incluyendo eliminación, sustitución, truncamiento y traducción, con algunos errores ocurriendo incluso bajo distribuciones de salida concentradas.
- Se evaluaron señales geométricas, encontrando que la proximidad entre las incrustaciones de entrada y salida logró una AUROC de 0,744 a 0,881 en siete modelos para identificar estos tokens.
- Se mostró que los candidatos frágiles seleccionados se conservan con menos frecuencia que los controles estables en tareas de instrucciones y uso simulado de herramientas.
Los hallazgos motivan el uso de protocolos de verificación contextual, argumentando que superar una prueba de aislamiento no debe tratarse como un certificado general de fiabilidad literal.