Douyin ha publicado el informe técnico de su modelo de Incrustación Multimodal (DME), que combina preentrenamiento contrastivo a gran escala con razonamiento latente para lograr una fuerte discriminación y eficiencia.
- Entrenado en dos etapas: la Etapa 1 establece un espacio de incrustación multimodal unificado mediante preentrenamiento contrastivo, mientras que la Etapa 2 utiliza Razonamiento Latente Tipado Basado en Evidencia y Reconstrucción Cruzada-Condicional para mejorar la suficiencia semántica.
- Ambos mecanismos actúan únicamente durante el entrenamiento, lo que permite que DME se sirva con una sobrecarga marginal del lado de la consulta comparable a la de los codificadores contrastivos estándar.
- En MMEB-v2, las variantes de 2B y 9B alcanzan resultados de vanguardia con puntuaciones de 74.8 y 78.4, mostrando una fuerza particular en tareas de video y documentos visuales.
- En producción, DME ofrece una ganancia relativa del 2.92% en el conjunto de evaluación offline de Douyin y una ganancia del 0.1% en Lifetime (LT) en pruebas A/B en línea para búsqueda.
El modelo se despliega en diversos escenarios de Douyin, incluyendo generación, imágenes y búsqueda con IA, abordando la necesidad tanto de eficiencia bajo indexación a escala de mil millones como de discriminación fina.