Tencent은 Qwen3.5를 기반으로 구축된 범용 멀티모달 임베딩 모델인 WeMM-Embedding-9B를 출시했으며, 텍스트, 이미지, 비디오, 시각적 문서 및 인터리브된 입력을 받아 4,096차원 L2 정규화 임베딩을 반환합니다.

이 모델은 콘텐츠 항목의 어떤 하위 집합도 독립적으로 인코딩할 수 있으며 Hugging Face transformers, sentence-transformers, vLLM 및 SGLang를 통해 사용할 수 있습니다. 이미지 및 비디오 작업에 대해 MMEB-v2 벤치마크의 78개 데이터셋에서 평가되었으며, NDCG@5를 사용하여 시각적 문서 작업에서도 평가되었습니다.

릴리스에는 Apache License 2.0 하의 코드, 모델 매개변수 및 가중치가 포함되어 있습니다.