Sentence Transformers 库引入了 MultiVectorEncoder,这是一个支持利用晚期交互检索的多向量嵌入模型训练与微调的组件。此新增功能使用户能够从零构建强大的多向量模型,或将其适配到特定领域,而无需依赖通用检索器。
- 该实现支持 ColBERT 风格架构,其中词元级匹配保留了细粒度信号,以实现更强的检索性能。
- 用户可以对现有检查点(如 mLateOn-unsupervised)进行微调,或使用 ModernBERT 等基础 Transformer 初始化全新模型。
- 训练需要特定组件,包括数据集、损失函数和评估器,并支持 Hugging Face Datasets Hub 格式。
- 作者演示了在医疗数据上进行微调的表现优于通用密集、稀疏和词汇模型。
该方法能够在消费级硬件上于数小时内实现领域特定适配,解决了标准检索模型中文档截断的局限性。