Tencent выпустила WeMM-Embedding-4B, универсальную мультимодельную модель встраивания на базе Qwen3.5, которая принимает текст, изображения, видео, визуальные документы и чередующиеся входные данные для возврата 2560-мерных L2-нормализованных векторов.

Модель поддерживает независимое кодирование любого подмножества контента и доступна через pip install с библиотеками transformers и sentence-transformers. Она также предлагает интеграцию с vLLM 0.27.0 для пулинга при выводе и SGLang 0.5.9 для точной интерполяции встраиваний.

WeMM-Embedding-4B демонстрирует высокую производительность на 78 наборах данных из бенчмарка MMEB-v2, используя Hit@1 для задач с изображениями/видео и NDCG@5 для визуальных документов.