أطلقت تينسنت نموذج التضمين متعدد الوسائط الشامل WeMM-Embedding-4B، المبني على Qwen3.5، والذي يقبل النصوص والصور ومقاطع الفيديو والمستندات المرئية والإدخالات المتشابكة لإرجاع تضمينات L2-mormalized ذات الأبعاد 2,560.
يدعم النموذج الترميز المستقل لأي مجموعة فرعية من المحتوى وهو متاح عبر pip install مع مكتبات transformers و sentence-transformers. كما يوفر تكاملاً مع vLLM 0.27.0 للاستدلال بالتجميع و SGLang 0.5.9 للتداخل الدقيق للتضمينات.
يُظهر WeMM-Embedding-4B أداءً قوياً عبر 78 مجموعة بيانات من benchmark MMEB-v2، باستخدام Hit@1 لمهام الصور/الفيديو و NDCG@5 للمستندات المرئية.