Tencent a publié WeMM-Embedding-9B, un modèle d'embedding multimodal universel basé sur Qwen3.5 qui accepte du texte, des images, des vidéos, des documents visuels et des entrées entrelacées pour retourner des embeddings L2-normalisés de 4 096 dimensions.

Le modèle prend en charge l'encodage indépendant de tout sous-ensemble d'éléments de contenu et est disponible via Hugging Face transformers, sentence-transformers, vLLM et SGLang. Il a été évalué sur 78 jeux de données du benchmark MMEB-v2 pour les tâches d'image et de vidéo, ainsi que pour les tâches de documents visuels en utilisant NDCG@5.

La publication inclut le code, les paramètres du modèle et les poids sous la licence Apache License 2.0.