Исследование показывает, что фильтры на этапе приёма не могут предотвратить скоординированные атаки отравления систем векторного поиска, поскольку геометрически идентичные паттерны существуют как для легитимных нишевых загрузок, так и для вредоносных инъекций. Исследователи демонстрируют, что небольшое количество обычных документов может окружать целевой запрос, захватывая результаты top-k в бенчмарках BGE-large / BEIR.

  • Координированный злоумышленник внедряет m=10 документов, которые совместно манипулируют индексом, достигая успеха 10/10 на BGE-large / BEIR и 9.9/10 на живом индексе HNSW.
  • Атака реализуется как обычный связный текст в конвейере BGE-large + HNSW + Qwen2.5-7B, заставляя генератор выдавать внедрённые утверждения в 88% целей против 0% без инъекции.
  • Никакая защита на этапе загрузки не останавливает это; самый сильный обученный классификатор разделяет атаки и легитимные загрузки не лучше случайного угадывания, выявляя лишь 4.2% атак при уровне ложноположительных срабатываний 1%.
  • Фундаментальное ограничение возникает потому, что сигнал, отделяющий атаку от легитимной загрузки — запросный спрос — невидим до момента поиска.

Авторы приходят к выводу, что надёжная защита должна выйти за рамки шлюзов приёма и наблюдать спрос на этапе извлечения, где детекторы выявляют 100% этих атак при том же уровне ложноположительных срабатываний 1%.