Компания Tencent выпустила универсальную мультимодельную модель встраивания WeMM-Embedding-9B, созданную на базе Qwen3.5 и принимающую текст, изображения, видео, визуальные документы и чередующиеся входные данные для возврата 4096-мерных L2-нормализованных векторов.

Модель поддерживает кодирование любого подмножества элементов контента независимо и доступна через Hugging Face transformers, sentence-transformers, vLLM и SGLang. Она была оценена на 78 наборах данных из бенчмарка MMEB-v2 для задач с изображениями и видео, а также для задач с визуальными документами с использованием метрики NDCG@5.

В релиз включены код, параметры модели и веса под лицензией Apache License 2.0.