"複数ターンLLC汚染における認識論的ポリシーの分岐:プロトコル勾配調査"と題された研究は、会話履歴に注入された誤った前提を大規模言語モデルがどのように処理するかを評価するものであり、この失敗モードはセッションレベルの汚染と呼ばれています。研究者たちは、温度ゼロで22,500ターンを用いて10の知識領域においてGPT-5.4 Mini、Gemini-3.1 Flash-Lite、GLM-4.5-Airをテストしました。
- GPT-5.4 Miniはコンテンツに依存しないポリシーを示し、すべての500セッションで誤った前提を採用しませんでした。
- Gemini-3.1 Flash-Liteは急峻な権威勾配に従い、自己帰属の虚偽では採用率が0.1%から、指示のオーバーライド下では94.0%に達しました。
- GLM-4.5-Airはより緩やかな勾配(15.8%対84.2%)を示し、影響を受けたセッションの94.5%で回復しましたが、Geminiの場合は60.0%にとどまりました。
著者たちは、会話履歴が信頼できない攻撃面として機能し、出所認識型のシステム設計が必要であると結論付け、完全なフレームワークをオープンソースベンチマークとして公開しました。