В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.

  • Протестированы восемь моделей с открытым весом из семейств Qwen и OLMo с использованием фиксированных идентификаторов токенов, вставленных в случайные последовательности общих слов различной длины.
  • Выявлено, что экран на основе вероятности помечает от 0,4% до 10,9% токенов, прошедших изоляцию, как уязвимых по крайней мере в 10% протестированных контекстов.
  • Продемонстрированы конкретные режимы сбоев, включая удаление, замену, усечение и перевод, при этом некоторые ошибки возникали даже при концентрированных распределениях вывода.
  • Оценены геометрические сигналы, показавшие, что близость входных и выходных эмбеддингов достигла AUROC от 0,744 до 0,881 на семи моделях для идентификации этих токенов.
  • Показано, что выбранные хрупкие кандидаты сохраняются реже, чем стабильные контрольные образцы, в задачах инструкций и симулированного использования инструментов.

Полученные результаты обосновывают необходимость использования протоколов контекстной верификации, утверждая, что прохождение изоляционного теста не должно рассматриваться как общий сертификат буквальной надежности.