텐센트는 Qwen3.5를 기반으로 구축된 범용 멀티모달 임베딩 모델인 WeMM-Embedding-4B를 출시했습니다. 이 모델은 텍스트, 이미지, 비디오, 시각적 문서 및 인터리브된 입력을 받아 2,560차원 L2 정규화 임베딩을 반환합니다.

이 모델은 임의의 콘텐츠 하위 집합의 독립적인 인코딩을 지원하며 transformers 및 sentence-transformers 라이브러리와 함께 pip install로 사용할 수 있습니다. 또한 풀링 추론을 위한 vLLM 0.27.0 및 정확한 임베딩 보간을 위한 SGLang 0.5.9와의 통합도 제공합니다.

WeMM-Embedding-4B는 MMEB-v2 벤치마크의 78개 데이터셋에서 강력한 성능을 보여주며, 이미지/비디오 작업에는 Hit@1을, 시각적 문서에는 NDCG@5를 사용합니다.