Tencent ha lanzado WeMM-Embedding-9B, un modelo de incrustación multimodal universal basado en Qwen3.5 que acepta texto, imágenes, videos, documentos visuales y entradas entrelazadas para devolver incrustaciones L2-normalizadas de 4.096 dimensiones.

El modelo admite la codificación de cualquier subconjunto de elementos de contenido de forma independiente y está disponible a través de Hugging Face transformers, sentence-transformers, vLLM y SGLang. Fue evaluado en 78 conjuntos de datos del benchmark MMEB-v2 para tareas de imagen y video, así como para tareas de documentos visuales utilizando NDCG@5.

El lanzamiento incluye código, parámetros del modelo y pesos bajo la Licencia Apache 2.0.