Tencentは、Qwen3.5を基盤とした汎用マルチモーダル埋め込みモデルWeMM-Embedding-9Bをリリースしました。このモデルはテキスト、画像、動画、視覚文書、インターリーブされた入力を接受し、4,096次元のL2正規化埋め込みを返します。
モデルは任意のコンテンツアイテムのサブセットを独立してエンコードすることをサポートしており、Hugging Face transformers、sentence-transformers、vLLM、SGLangを通じて利用可能です。画像および動画タスク用のMMEB-v2ベンチマークの78データセット、ならびにNDCG@5を使用した視覚文書タスクで評価されました。
リリースにはApache License 2.0の下でのコード、モデルパラメータ、重みが含まれています。