Douyin telah merilis laporan teknis untuk model Embedding Multimodal (DME)-nya, yang menggabungkan pra-pelatihan kontrasif skala besar dengan penalaran laten untuk mencapai diskriminasi dan efisiensi yang kuat.

  • Dilatih dalam dua tahap: Tahap 1 membangun ruang embedding multimodal terpadu melalui pra-pelatihan kontrasif, sementara Tahap 2 menggunakan Penalaran Laten Berbasis Tipe yang Berlandaskan Bukti dan Rekonstruksi Silang-Kondisional untuk meningkatkan kecukupan semantik.
  • Kedua mekanisme hanya berfungsi selama pelatihan, memungkinkan DME beroperasi dengan overhead sisi kueri yang marginal, sebanding dengan encoder kontrasif standar.
  • Pada MMEB-v2, varian 2B dan 9B mencapai hasil terkini dengan skor 74.8 dan 78.4, menunjukkan kekuatan khusus dalam tugas video dan dokumen visual.
  • Dalam produksi, DME memberikan peningkatan relatif sebesar 2.92% pada set evaluasi offline Douyin dan peningkatan Lifetime (LT) sebesar 0.1% dalam pengujian A/B online untuk pencarian.

Model ini diimplementasikan di berbagai skenario Douyin termasuk generatif, gambar, dan pencarian AI, mengatasi kebutuhan akan efisiensi di bawah indeks skala miliaran serta diskriminasi halus.