Tencent ha lanzado WeMM-Embedding-4B, un modelo de incrustación multimodal universal basado en Qwen3.5 que acepta texto, imágenes, videos, documentos visuales y entradas intercaladas para devolver incrustaciones L2-normalizadas de 2.560 dimensiones.
El modelo admite la codificación independiente de cualquier subconjunto de contenido y está disponible mediante pip install con las bibliotecas transformers y sentence-transformers. También ofrece integración con vLLM 0.27.0 para inferencia por agrupamiento y SGLang 0.5.9 para interpolación precisa de incrustaciones.
WeMM-Embedding-4B demuestra un rendimiento sólido en 78 conjuntos de datos del benchmark MMEB-v2, utilizando Hit@1 para tareas de imagen/video y NDCG@5 para documentos visuales.