抖音发布了其多模态嵌入(DME)模型的技术报告,该模型结合大规模对比预训练与潜在推理,实现了强大的判别能力和效率。

  • 分两个阶段训练:第一阶段通过对比预训练建立统一的多模态嵌入空间,第二阶段利用证据锚定的类型化潜在推理和跨条件重建来增强语义充分性。
  • 这两种机制仅在训练期间起作用,使得DME在查询端开销极小的情况下提供服务,其开销与标准对比编码器相当。
  • 在MMEB-v2上,2B和9B变体取得了领先的结果,得分分别为74.8和78.4,在视频和视觉文档任务中表现出特别强的能力。
  • 在生产环境中,DME在抖音离线评估集上实现了2.92%的相对提升,并在搜索的在线A/B测试中实现了0.1%的生命周期(LT)提升。

该模型已部署到抖音的生成、图像和AI搜索等场景中,满足了在十亿级索引下的效率需求以及细粒度判别的需求。