O Douyin publicou o relatório técnico de seu modelo Multimodal Embedding (DME), que combina pré-treinamento contrastivo em larga escala com raciocínio latente para alcançar forte discriminação e eficiência.

  • Treinado em duas etapas: a Etapa 1 estabelece um espaço de incorporação multimodal unificado por meio de pré-treinamento contrastivo, enquanto a Etapa 2 utiliza Raciocínio Latente Tipado Baseado em Evidências e Reconstrução Cruzada-Condicional para aprimorar a suficiência semântica.
  • Ambos os mecanismos atuam apenas durante o treinamento, permitindo que o DME seja servido com sobrecarga marginal do lado da consulta comparável à de codificadores contrastivos padrão.
  • No MMEB-v2, as variantes de 2B e 9B alcançam resultados de ponta com pontuações de 74,8 e 78,4, demonstrando força particular em tarefas de vídeo e documentos visuais.
  • Em produção, o DME oferece um ganho relativo de 2,92% no conjunto de avaliação offline do Douyin e um ganho de 0,1% no Lifetime (LT) nos testes A/B online para busca.

O modelo é implantado em cenários do Douyin, incluindo generativo, imagem e busca por IA, atendendo à necessidade tanto de eficiência sob indexação em escala de bilhões quanto de discriminação fina.