腾讯发布了基于 Qwen3.5 构建的通用多模态嵌入模型 WeMM-Embedding-9B,该模型接受文本、图像、视频、视觉文档和交错输入,以返回 4,096 维的 L2 归一化嵌入。

该模型支持独立编码任何子集的内容项,可通过 Hugging Face transformers、sentence-transformers、vLLM 和 SGLang 获取。它在 MMEB-v2 基准测试的 78 个数据集上进行了评估,涵盖图像和视频任务,以及使用 NDCG@5 的视觉文档任务。

此次发布包含在 Apache License 2.0 许可下的代码、模型参数和权重。