Une étude intitulée « Divergence des politiques épistémiques dans la contamination des LLM multi-tours : Une investigation par gradient de protocole » évalue comment les grands modèles de langage gèrent les prémisses fausses injectées dans l'historique de conversation, un mode d'échec appelé contamination au niveau de la session. Les chercheurs ont testé GPT-5.4 Mini, Gemini-3.1 Flash-Lite et GLM-4.5-Air sur dix domaines de connaissances en utilisant 22 500 tours à température nulle.
- GPT-5.4 Mini a démontré une politique indépendante du contenu avec zéro adoption de prémisses fausses sur l'ensemble des 500 sessions.
- Gemini-3.1 Flash-Lite a suivi un gradient d'autorité prononcé, montrant des taux d'adoption allant de 0,1 % pour les faussetés auto-attribuées à 94,0 % sous override d'instruction.
- GLM-4.5-Air a exhibé un gradient plus faible (15,8 % contre 84,2 %) et s'est rétabli dans 94,5 % des sessions affectées, comparé à seulement 60,0 % pour Gemini.
Les auteurs concluent que l'historique de conversation agit comme une surface d'attaque non fiable nécessitant une conception de système consciente de la provenance, et ils ont publié le cadre complet en tant que benchmark open-source.