一项研究表明,准入时的过滤器无法防止针对向量检索系统的协同投毒攻击,因为合法的小众上传与恶意注入之间存在几何上相同的模式。研究人员表明,少量不起眼的文档可以围绕目标查询,从而在 BGE-large / BEIR 基准测试中劫持 top-k 结果。
- 协同对手注入 m=10 个文档,共同操纵索引,在 BGE-large / BEIR 上实现 10/10 的成功率,在实时 HNSW 索引上达到 9.9/10。
- 该攻击以普通流畅文本的形式实现在 BGE-large + HNSW + Qwen2.5-7B 管道中,导致生成器在 88% 的目标中输出植入的声明,而在未注入的情况下为 0%。
- 没有任何摄取时防御能阻止这一点;最强的训练分类器区分攻击与合法上传的效果并不优于随机猜测,仅在 1% 的误报率下捕获了 4.2% 的攻击。
- 根本限制源于分离攻击与合法摄取的信号——查询需求——在检索前是不可见的。
作者得出结论,鲁棒的防御必须超越准入门控,以在检索时观察需求,此时检测器在相同的 1% 误报率下捕获了 100% 的这些攻击。