Douyinは、大規模な対照的事前学習と潜在推論を組み合わせて、強力な識別力と効率性を実現するマルチモーダル埋め込み(DME)モデルの技術レポートを公開しました。

  • 2段階で訓練: ステージ1では対照的事前学習により統一されたマルチモーダル埋め込み空間を確立し、ステージ2では根拠付き型潜在推論と相互条件再構築を用いて意味的な十分性を強化します。
  • 両方のメカニズムは訓練中のみ作用するため、DMEは標準的な対照的エンコーダと比較してクエリ側のオーバーヘッドが僅かな状態で提供できます。
  • MMEB-v2において、2Bおよび9Bのバリアントが74.8と78.4のスコアで最先端の結果を達成し、動画および視覚文書タスクで特に強力な性能を示しています。
  • 本番環境では、DMEはDouyinのオフライン評価セットで2.92%の相対的な向上をもたらし、検索におけるオンラインA/Bテストで0.1%のLifetime (LT) の向上を実現しました。

このモデルは、生成、画像、AI検索を含むDouyinのシナリオに展開され、十億規模のインデックス付けにおける効率性と細粒度な識別力の両方のニーズに対応しています。