Un estudio titulado "Divergencia de Política Epistémica en Contaminación de LLMs Multi-Turno: Una Investigación de Gradiente de Protocolo" evalúa cómo los modelos de lenguaje grandes manejan premisas falsas inyectadas en el historial de conversación, un modo de fallo denominado contaminación a nivel de sesión. Los investigadores probaron GPT-5.4 Mini, Gemini-3.1 Flash-Lite y GLM-4.5-Air en diez dominios de conocimiento utilizando 22,500 turnos con temperatura cero.

  • GPT-5.4 Mini demostró una política independiente del contenido con cero adopciones de premisas falsas en todas las 500 sesiones.
  • Gemini-3.1 Flash-Lite siguió un gradiente de autoridad pronunciado, mostrando tasas de adopción que van desde el 0.1% para falsedades autoatribuidas hasta el 94.0% bajo anulación por instrucción.
  • GLM-4.5-Air exhibió un gradiente más suave (15.8% frente a 84.2%) y se recuperó en el 94.5% de las sesiones afectadas, en comparación con solo el 60.0% para Gemini.

Los autores concluyen que el historial de conversación actúa como una superficie de ataque no confiable que requiere un diseño de sistema consciente de la procedencia, y han publicado el marco completo como un benchmark de código abierto.