Sentence Transformers 第 6 版引入了 MultiVectorEncoder 类,允许在库内直接进行类似 ColBERT 的晚期交互(late interaction)检索,而无需 PyLate 等外部依赖。此新增功能使用户能够通过统一的 API 从各种来源加载多向量检查点,包括 PyLate 和 Stanford-NLP 格式。

  • 多向量模型通过为每个 token 保留一个向量来保留 token 级信息,并通过 MaxSim 算子对查询与文档进行评分,从而比单向量密集嵌入提高检索质量。
  • 该实现支持通过 colpali-engine 模型进行视觉文档检索,并原生处理各种检查点格式。
  • 使用 fast-plaid 等索引策略来管理与为每个 token 存储向量相关的增加存储成本。

此功能将晚期交互能力带入 Sentence Transformers 核心生态系统,允许用户利用最先进的检索方法,同时保持与现有密集和稀疏模型工作流的兼容性。