연구 결과, 데이터 수집 시점 필터가 벡터 검색 시스템에 대한 조율된 오염 공격을 방지할 수 없으며, 합법적인 니치 업로드와 악의적 삽입 모두에서 기하학적으로 동일한 패턴이 존재한다는 사실이 입증되었습니다. 연구진은 소수의 평범한 문서가 타겟 쿼리를 둘러싸 BGE-large / BEIR 벤치마크에서 top-k 결과를 장악할 수 있음을 보여줍니다.

  • 조율된 적대자가 m=10개의 문서를 삽입하여 인덱스를 집단적으로 조작하며, BGE-large / BEIR에서 10/10의 성공률과 실시간 HNSW 인덱스에서 9.9/10의 성공률을 달성합니다.
  • 이 공격은 BGE-large + HNSW + Qwen2.5-7B 파이프라인 내의 일반 유동 텍스트로 구현되어, 삽입 시 타겟의 88%에서 식별된 주장을 생성하는 반면, 삽입 없이는 0%입니다.
  • 데이터 수집 시점의 어떤 방어책도 이를 막지 못하며, 가장 강력한 훈련된 분류기조차 공격과 합법적 업로드를 기회 추측보다 더 잘 구분하지 못해, 1%의 위양성률에서 공격의 4.2%만 포착합니다.
  • 근본적인 한계는 공격과 합법적 수집을 구분하는 신호—쿼리 수요가—검색 전에 보이지 않기 때문에 발생합니다.

저자들은 강력한 방어를 위해서는 데이터 수집 게이트를 넘어 검색 시점에 수요를 관찰해야 하며, 동일한 1%의 위양성률에서 탐지기가 이러한 공격의 100%를 포착할 수 있다고 결론짓습니다.