Tencent telah merilis WeMM-Embedding-4B, sebuah model embedding multimodal universal yang dibangun di atas Qwen3.5 yang menerima teks, gambar, video, dokumen visual, dan input interleave untuk mengembalikan embedding L2-normalized berdimensi 2.560.

Model ini mendukung pengodean independen dari subset konten apa pun dan tersedia melalui pip install dengan library transformers dan sentence-transformers. Model ini juga menawarkan integrasi dengan vLLM 0.27.0 untuk inferensi pooling dan SGLang 0.5.9 untuk interpolasi embedding yang presisi.

WeMM-Embedding-4B menunjukkan kinerja kuat di 78 dataset dari benchmark MMEB-v2, menggunakan Hit@1 untuk tugas gambar/video dan NDCG@5 untuk dokumen visual.