Douyin опубликовала технический отчет о своей модели мультимодального встраивания (DME), которая сочетает крупномасштабное контрастное предобучение с латентным рассуждением для достижения высокой дискриминации и эффективности.
- Обучение проходит в два этапа: на первом этапе создается единое пространство мультимодального встраивания посредством контрастного предобучения, а на втором — используются доказательные типизированные латентные рассуждения и кросс-условная реконструкция для улучшения семантической достаточности.
- Оба механизма действуют только во время обучения, что позволяет DME обслуживать запросы с минимальными накладными расходами на стороне клиента, сопоставимыми со стандартными контрастными кодировщиками.
- На наборе данных MMEB-v2 модели размером 2B и 9B достигают передовых результатов с показателями 74.8 и 78.4, демонстрируя особую силу в задачах обработки видео и визуальных документов.
- В производственной среде DME обеспечивает относительное улучшение на 2.92% на офлайн-наборе данных Douyin и прирост Lifetime (LT) на 0.1% в онлайн A/B тестировании для поиска.
Модель развернута во многих сценариях Douyin, включая генеративные, работу с изображениями и AI-поиск, удовлетворяя потребности как в эффективности при индексации миллиардных масштабов, так и в тонкой дискриминации.