A Tencent lançou o WeMM-Embedding-9B, um modelo de embedding multimodal universal construído sobre o Qwen3.5 que aceita texto, imagens, vídeos, documentos visuais e entradas intercaladas para retornar embeddings L2-normalizados de 4.096 dimensões.

O modelo suporta a codificação de qualquer subconjunto de itens de conteúdo de forma independente e está disponível via Hugging Face transformers, sentence-transformers, vLLM e SGLang. Foi avaliado em 78 conjuntos de dados do benchmark MMEB-v2 para tarefas de imagem e vídeo, bem como para tarefas de documentos visuais usando NDCG@5.

O lançamento inclui código, parâmetros do modelo e pesos sob a Licença Apache 2.0.