연구자들은 "오래된 문서 오염"을 확인했는데, 이는 Retrieval-Augmented Generation (RAG)에서의 시간 정렬 실패로, 오래된 외부 증거가 모델을 올바른 응답을 알고 있음에도 불구하고 잘못된 답변을 제공하게 만든다.
- 연구는 의학, 법률, 소프트웨어 및 플랫폼 정책 분야에서 317개의 검증된 지식 반전을 포함하는 벤치마크를 구축했다.
- 지시사항 없이도 문서를 신뢰하라는 명령이 없더라도, 오래된 검색은 Llama의 30%, Qwen의 37% 답변을 뒤집는다.
- 명시적인 후속 지시사항은 Llama의 경우 오염률을 66%, Qwen의 경우 75%까지 높인다.
- 오염률은 네 가지 오픈 모델과 도메인 전반에 걸쳐 17-91% 범위를 보이며, 최신 증거는 실험의 97-100%에서 따랐다.
- 날짜가 정확한 경우 고정된 시점 인식 하이브리드 재순위기는 오염률을 4.6-10.0 포인트 감소시킨다.
이 결과는 신뢰할 수 있는 RAG를 위해서는 선택적 신뢰가 필요하며, 모델은 검색된 증거가 무엇을 말하는지뿐만 아니라 그것이 여전히 적용되는지도 결정해야 함을 나타낸다.