腾讯发布了EVIE-4.5B,这是一款高性能的多语言视觉文档检索模型,具备动态前缀多向量检索延迟(Prefix-MRL)和无需训练的层次凝聚聚类(HAC)token压缩技术。

  • EVIE-4.5B在ViDoRe V3 Public基准上使用单投影Prefix-MRL取得66.02分,而更大的EVIE-8B变体得分为66.75。
  • 该模型支持从2048D到64D的运行时维度截断,无需单独模型,在所有尺寸下均保持高检索精度。
  • 免训练的HAC将每页约750个向量的token数量压缩至32个,使索引存储量降至每百万页3.81 GiB。
  • 该模型在ViDoRe V1、V2、V3和JinaVDR上的138项多语言任务中进行了评估,在英语、法语、德语、西班牙语、阿拉伯语和中文方面表现出强劲性能。
  • EVIE-4.5B使用EVIE-ARD配方从EVIE-8B教师模型蒸馏而来,该配方采用锚点保持、容量感知的关系蒸馏技术。

此次发布提供了一种灵活的视觉文档检索解决方案,通过动态嵌入维度和token压缩,在保持高精度的同时显著降低了存储需求。