一项题为“多轮LLM污染中的认知策略分歧:一种协议梯度调查”的研究评估了大型语言模型如何处理注入对话历史中的错误前提,这种故障模式被称为会话级污染。研究人员在十个知识领域中对GPT-5.4 Mini、Gemini-3.1 Flash-Lite和GLM-4.5-Air进行了测试,共使用22,500个回合,温度为零。
- GPT-5.4 Mini表现出与内容无关的策略,在所有500个会话中对错误前提的采纳率为零。
- Gemini-3.1 Flash-Lite遵循陡峭的权威梯度,其采纳率从自我归因的错误事实的0.1%到指令覆盖下的94.0%不等。
- GLM-4.5-Air表现出较浅的梯度(15.8%对比84.2%),并在94.5%的受影响会话中恢复,而Gemini仅为60.0%。
作者得出结论,对话历史作为一个不受信任的攻击面,需要具有来源感知能力的系统设计,并且他们已将完整框架作为开源基准发布。