В исследовании описываются «FragileTokens» — элементы словаря моделей языка с открытым весом, которые успешно копируются при изоляции, но демонстрируют ошибки при встраивании в окружающий текст. Исследование подчеркивает, что буквальное сохранение идентичности не гарантируется стандартными изоляционными тестами, поскольку токены могут быть удалены, заменены или усечены внутри последовательностей.
- Протестированы восемь моделей с открытым весом из семейств Qwen и OLMo с использованием фиксированных идентификаторов токенов, вставленных в случайные последовательности общих слов различной длины.
- Выявлено, что экран на основе вероятности помечает от 0,4% до 10,9% токенов, прошедших изоляцию, как уязвимых по крайней мере в 10% протестированных контекстов.
- Продемонстрированы конкретные режимы сбоев, включая удаление, замену, усечение и перевод, при этом некоторые ошибки возникали даже при концентрированных распределениях вывода.
- Оценены геометрические сигналы, показавшие, что близость входных и выходных эмбеддингов достигла AUROC от 0,744 до 0,881 на семи моделях для идентификации этих токенов.
- Показано, что выбранные хрупкие кандидаты сохраняются реже, чем стабильные контрольные образцы, в задачах инструкций и симулированного использования инструментов.
Полученные результаты обосновывают необходимость использования протоколов контекстной верификации, утверждая, что прохождение изоляционного теста не должно рассматриваться как общий сертификат буквальной надежности.