"Epistemic Policy Divergence in Multi-Turn LLM Contamination: A Protocol-Gradient Investigation"라는 제목의 연구는 대화 기록에 주입된 거짓 전제를 대형 언어 모델이 어떻게 처리하는지 평가하며, 이는 세션 레벨 오염이라는 실패 모드로 명명됩니다. 연구자들은 GPT-5.4 Mini, Gemini-3.1 Flash-Lite, GLM-4.5-Air를 22,500 턴의 온도 제로 조건으로 열 가지 지식 도메인에서 테스트했습니다.

  • GPT-5.4 Mini는 모든 500개 세션에서 거짓 전제를 전혀 수용하지 않는 콘텐츠 독립적 정책을 보여주었습니다.
  • Gemini-3.1 Flash-Lite는 가파른 권위 기울기를 따랐으며, 자기 귀속 허위에 대해서는 0.1%의 수용률에서 명령 재정의 하에서는 94.0%까지 범위를 보였습니다.
  • GLM-4.5-Air는 더 완만한 기울기(15.8% 대 84.2%)를 보였으며, Gemini의 60.0%에 비해 영향을 받은 세션의 94.5%에서 회복했습니다.

저자들은 대화 기록이 출처 인식 시스템 설계를 필요로 하는 신뢰할 수 없는 공격 표면으로 작용한다고 결론내렸으며, 완전한 프레임워크를 오픈소스 벤치마크로 공개했습니다.