Tencent a publié WeMM-Embedding-4B, un modèle d'embedding multimodal universel basé sur Qwen3.5 qui accepte du texte, des images, des vidéos, des documents visuels et des entrées entrelacées pour retourner des embeddings L2-normalisés de 2 560 dimensions.

Le modèle prend en charge l'encodage indépendant de n'importe quel sous-ensemble de contenu et est disponible via pip install avec les bibliothèques transformers et sentence-transformers. Il offre également une intégration avec vLLM 0.27.0 pour le pooling d'inférence et SGLang 0.5.9 pour l'interpolation précise des embeddings.

WeMM-Embedding-4B démontre de solides performances sur 78 ensembles de données du benchmark MMEB-v2, utilisant Hit@1 pour les tâches image/vidéo et NDCG@5 pour les documents visuels.