Tencent a lancé WeMM-Embedding-2B, un modèle universel d'embedding multimodal basé sur Qwen3.5 qui accepte du texte, des images, des vidéos, des documents visuels et des entrées entrelacées pour retourner des embeddings L2-normalisés de 2 048 dimensions.

Le modèle prend en charge l'encodage indépendant de n'importe quel sous-ensemble de contenu et utilise des dimensions Matryoshka, où les embeddings de 256 dimensions conservent 98,7 % des performances pleines sur MMEB-v2.

Il est disponible sous la licence Apache License 2.0 avec le code et les poids publiés publiquement, et inclut des exemples d'intégration pour sentence-transformers, vLLM et SGLang.