腾讯发布了基于 Qwen3.5 构建的通用多模态嵌入模型 WeMM-Embedding-4B,该模型接受文本、图像、视频、视觉文档和交错输入,返回 2,560 维 L2 归一化嵌入。

该模型支持对任意内容子集进行独立编码,可通过 pip install 配合 transformers 和 sentence-transformers 库使用。它还支持与 vLLM 0.27.0 集成用于池化推理,以及与 SGLang 0.5.9 集成用于精确的嵌入插值。

WeMM-Embedding-4B 在 MMEB-v2 基准测试的 78 个数据集上表现出强劲的性能,针对图像/视频任务使用 Hit@1,针对视觉文档使用 NDCG@5。