Douyin a publié le rapport technique de son modèle Multimodal Embedding (DME), qui combine un pré-entraînement contrastif à grande échelle avec un raisonnement latent pour atteindre une forte capacité de discrimination et une efficacité.

  • Entraîné en deux étapes : l'étape 1 établit un espace d'encodage multimodal unifié via un pré-entraînement contrastif, tandis que l'étape 2 utilise un Raisonnement Latent Typé Ancré sur les Preuves et une Reconstruction Croisée Conditionnelle pour améliorer la suffisance sémantique.
  • Les deux mécanismes n'agissent que pendant l'entraînement, permettant à DME d'être servi avec une surcharge côté requête marginale comparable à celle des encodeurs contrastifs standards.
  • Sur MMEB-v2, les variantes 2B et 9B atteignent des résultats de pointe avec des scores de 74,8 et 78,4, montrant une force particulière dans les tâches vidéo et de documents visuels.
  • En production, DME offre un gain relatif de 2,92 % sur l'ensemble d'évaluation hors ligne de Douyin et un gain de 0,1 % en durée de vie (LT) lors des tests A/B en ligne pour la recherche.

Le modèle est déployé dans divers scénarios de Douyin, notamment la génération, l'image et la recherche IA, répondant au besoin à la fois d'efficacité sous un indexage à l'échelle du milliard et d'une discrimination fine.