研究者らは、「古い文書の汚染」という時間的整合性の失敗を特定した。これは、Retrieval-Augmented Generation (RAG) において、古びた外部証拠が、検索なしでは正しい応答を知っているにもかかわらず、モデルが誤った回答を提供する原因となる現象である。
- この研究は、医学、法律、ソフトウェア、プラットフォームポリシーにわたる317件の検証済みの知識の反転からなるベンチマークを構築した。
- 古びた検索結果は、文書を信頼するよう指示がない場合でも、Llama の回答の30% と Qwen の回答の37% を反転させる。
- 明示的なフォローアップ指示により、汚染率は Llama で66%、Qwen で75% に上昇する。
- 汚染率は4つのオープンモデルおよびドメイン間で17-91% の範囲にわたり、一方、最新の情報に従うケースは試行の97-100% であった。
- 日付が正確な場合、固定された時系列認識型ハイブリッド再ランク化により、汚染率は4.6-10.0ポイント減少する。
これらの知見は、信頼できる RAG には選択的な信頼が必要であり、モデルは検索された証拠の内容だけでなく、それがまだ適用可能かどうかを判断しなければならないことを示している。