Tencent telah merilis WeMM-Embedding-9B, sebuah model embedding multimodal universal yang dibangun di atas Qwen3.5 yang menerima teks, gambar, video, dokumen visual, dan input interleave untuk mengembalikan embedding L2-normalized berdimensi 4.096.
Model ini mendukung pengkodean subset item konten secara independen dan tersedia melalui Hugging Face transformers, sentence-transformers, vLLM, dan SGLang. Model ini dievaluasi pada 78 dataset dari benchmark MMEB-v2 untuk tugas gambar dan video, serta tugas dokumen visual menggunakan NDCG@5.
Rilis ini mencakup kode, parameter model, dan bobot di bawah Lisensi Apache 2.0.