Sebuah studi menunjukkan bahwa filter saat penerimaan tidak dapat mencegah serangan racun yang terkoordinasi pada sistem pengambilan vektor, karena pola yang identik secara geometris ada baik untuk unggahan niche yang sah maupun injeksi berbahaya. Para peneliti menunjukkan bahwa sejumlah kecil dokumen biasa dapat mengelilingi kueri target untuk merebut hasil top-k dalam benchmark BGE-large / BEIR.

  • Seorang penyerang terkoordinasi menyuntikkan m=10 dokumen yang secara kolektif memanipulasi indeks, mencapai keberhasilan 10/10 pada BGE-large / BEIR dan 9.9/10 pada indeks HNSW langsung.
  • Serangan ini diwujudkan sebagai teks lancar biasa dalam pipeline BGE-large + HNSW + Qwen2.5-7B, menyebabkan generator mengeluarkan klaim yang ditanam pada 88% target dibandingkan dengan 0% tanpa injeksi.
  • Tidak ada pertahanan saat ingestasi yang menghentikan ini; klasifikasi terlatih terkuat memisahkan serangan dari unggahan sah tidak lebih baik daripada peluang, menangkap hanya 4.2% serangan pada tingkat false-positive 1%.
  • Batas fundamental muncul karena sinyal yang memisahkan serangan dari ingestasi sah—permintaan kueri—tidak terlihat sebelum pengambilan.

Para penulis menyimpulkan bahwa pertahanan yang kuat harus bergerak melewati gerbang penerimaan untuk mengamati permintaan pada saat pengambilan, di mana detektor menangkap 100% serangan ini pada tingkat false-positive 1% yang sama.