Douyin telah merilis laporan teknis untuk model Embedding Multimodal (DME)-nya, yang menggabungkan pra-pelatihan kontrasif skala besar dengan penalaran laten untuk mencapai diskriminasi dan efisiensi yang kuat.
- Dilatih dalam dua tahap: Tahap 1 membangun ruang embedding multimodal terpadu melalui pra-pelatihan kontrasif, sementara Tahap 2 menggunakan Penalaran Laten Berbasis Tipe yang Berlandaskan Bukti dan Rekonstruksi Silang-Kondisional untuk meningkatkan kecukupan semantik.
- Kedua mekanisme hanya berfungsi selama pelatihan, memungkinkan DME beroperasi dengan overhead sisi kueri yang marginal, sebanding dengan encoder kontrasif standar.
- Pada MMEB-v2, varian 2B dan 9B mencapai hasil terkini dengan skor 74.8 dan 78.4, menunjukkan kekuatan khusus dalam tugas video dan dokumen visual.
- Dalam produksi, DME memberikan peningkatan relatif sebesar 2.92% pada set evaluasi offline Douyin dan peningkatan Lifetime (LT) sebesar 0.1% dalam pengujian A/B online untuk pencarian.
Model ini diimplementasikan di berbagai skenario Douyin termasuk generatif, gambar, dan pencarian AI, mengatasi kebutuhan akan efisiensi di bawah indeks skala miliaran serta diskriminasi halus.