O Douyin publicou o relatório técnico de seu modelo Multimodal Embedding (DME), que combina pré-treinamento contrastivo em larga escala com raciocínio latente para alcançar forte discriminação e eficiência.
- Treinado em duas etapas: a Etapa 1 estabelece um espaço de incorporação multimodal unificado por meio de pré-treinamento contrastivo, enquanto a Etapa 2 utiliza Raciocínio Latente Tipado Baseado em Evidências e Reconstrução Cruzada-Condicional para aprimorar a suficiência semântica.
- Ambos os mecanismos atuam apenas durante o treinamento, permitindo que o DME seja servido com sobrecarga marginal do lado da consulta comparável à de codificadores contrastivos padrão.
- No MMEB-v2, as variantes de 2B e 9B alcançam resultados de ponta com pontuações de 74,8 e 78,4, demonstrando força particular em tarefas de vídeo e documentos visuais.
- Em produção, o DME oferece um ganho relativo de 2,92% no conjunto de avaliação offline do Douyin e um ganho de 0,1% no Lifetime (LT) nos testes A/B online para busca.
O modelo é implantado em cenários do Douyin, incluindo generativo, imagem e busca por IA, atendendo à necessidade tanto de eficiência sob indexação em escala de bilhões quanto de discriminação fina.