ある研究により、受付時のフィルタではベクトル検索システムに対する協調的なポイズニング攻撃を防げないことが示された。正当なニッチなアップロードと悪意のあるインジェクションの両方に幾何学的に同一のパターンが存在するためである。研究者らは、わずかな数のありふれた文書がターゲットクエリを取り囲むことで、BGE-large / BEIRベンチマークにおいてトップkの結果を奪取できることを示した。

  • 協調的な攻撃者はm=10の文書をインジェクトし、それらがインデックス全体を操作することで、BGE-large / BEIRで10/10の成功、ライブHNSWインデックスで9.9/10の成功率を達成する。
  • この攻撃はBGE-large + HNSW + Qwen2.5-7Bパイプライン内の通常の流暢なテキストとして実現され、インジェクションがない場合の0%に対して、88%のターゲットで生成器が植え付けられた主張を発信させる。
  • 取り込み時の防御はこの攻撃を阻止できない。最も強力な訓練済み分類器でも、攻撃と正当なアップロードを偶然よりも良い精度で分離できず、1%の偽陽性率で攻撃の4.2%のみを検出する。
  • この根本的な限界は、攻撃と正当な取り込みを区別するシグナル(クエリ需要)が検索前に不可視であることに起因する。

著者らは、堅牢な防御は受付ゲートを超えて検索時の需要を観察する必要があると結論づけている。その場合、検出器は同じ1%の偽陽性率でこれらの攻撃を100%検出できる。