Um estudo intitulado "Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation" avalia como grandes modelos de linguagem lidam com premissas falsas injetadas no histórico da conversa, um modo de falha denominado contaminação em nível de sessão. Os pesquisadores testaram GPT-5.4 Mini, Gemini-3.1 Flash-Lite e GLM-4.5-Air em dez domínios de conhecimento usando 22.500 turnos com temperatura zero.

  • GPT-5.4 Mini demonstrou uma política independente do conteúdo, com zero adoções de premissas falsas em todas as 500 sessões.
  • Gemini-3.1 Flash-Lite seguiu um gradiente de autoridade íngreme, mostrando taxas de adoção que variam de 0,1% para falsidades autoatribuídas a 94,0% sob substituição por instrução.
  • GLM-4.5-Air exibiu um gradiente mais raso (15,8% vs 84,2%) e se recuperou em 94,5% das sessões afetadas, comparado a apenas 60,0% para Gemini.

Os autores concluem que o histórico da conversa atua como uma superfície de ataque não confiável, exigindo um design de sistema com consciência de proveniência, e lançaram o framework completo como um benchmark de código aberto.