A Tencent lançou o WeMM-Embedding-4B, um modelo de embedding multimodal universal baseado no Qwen3.5 que aceita texto, imagens, vídeos, documentos visuais e entradas intercaladas para retornar embeddings L2-normalizados de 2.560 dimensões.
O modelo suporta codificação independente de qualquer subconjunto de conteúdo e está disponível via pip install com as bibliotecas transformers e sentence-transformers. Ele também oferece integração com vLLM 0.27.0 para inferência por pooling e SGLang 0.5.9 para interpolação precisa de embeddings.
O WeMM-Embedding-4B demonstra forte desempenho em 78 conjuntos de dados do benchmark MMEB-v2, utilizando Hit@1 para tarefas de imagem/vídeo e NDCG@5 para documentos visuais.