Исследование под названием «Расхождение эпистемических политик при многоступенчатом загрязнении LLM: исследование протокольного градиента» оценивает, как большие языковые модели обрабатывают ложные посылки, внедрённые в историю разговора, — режим отказа, называемый загрязнением на уровне сессии. Исследователи протестировали GPT-5.4 Mini, Gemini-3.1 Flash-Lite и GLM-4.5-Air в десяти областях знаний, используя 22 500 шагов при температуре ноль.
- GPT-5.4 Mini продемонстрировал политику, независимую от контента, с нулевым принятием ложных посылок во всех 500 сессиях.
- Gemini-3.1 Flash-Lite следовал крутому градиенту авторитета, показывая уровни принятия от 0,1% для ложных утверждений, приписываемых самому себе, до 94,0% при переопределении инструкций.
- GLM-4.5-Air проявил более пологий градиент (15,8% против 84,2%) и восстановился в 94,5% затронутых сессий, по сравнению лишь с 60,0% для Gemini.
Авторы приходят к выводу, что история разговора действует как недоверенная поверхность атаки, требующая проектирования системы с учётом происхождения данных, и они выпустили полную основу в виде открытого бенчмарка.