Sebuah studi berjudul "Divergensi Kebijakan Epistemik dalam Kontaminasi LLM Multi-Giliran: Investigasi Gradien Protokol" mengevaluasi bagaimana model bahasa besar menangani premis palsu yang disuntikkan ke dalam riwayat percakapan, sebuah mode kegagalan yang disebut kontaminasi tingkat sesi. Para peneliti menguji GPT-5.4 Mini, Gemini-3.1 Flash-Lite, dan GLM-4.5-Air di sepuluh domain pengetahuan menggunakan 22.500 giliran pada suhu nol.
- GPT-5.4 Mini menunjukkan kebijakan yang independen dari konten dengan nol adopsi premis palsu di seluruh 500 sesi.
- Gemini-3.1 Flash-Lite mengikuti gradien otoritas yang curam, menunjukkan tingkat adopsi berkisar dari 0,1% untuk kebohongan yang dikaitkan sendiri hingga 94,0% saat ada pengabaian instruksi.
- GLM-4.5-Air menunjukkan gradien yang lebih landai (15,8% vs 84,2%) dan pulih di 94,5% dari sesi yang terpengaruh, dibandingkan hanya 60,0% untuk Gemini.
Para penulis menyimpulkan bahwa riwayat percakapan bertindak sebagai permukaan serangan yang tidak tepercaya yang memerlukan desain sistem yang sadar asal-usul, dan mereka telah merilis kerangka kerja lengkap sebagai benchmark sumber terbuka.