डौइयां ने अपने मल्टीमोडल एम्बेडिंग (DME) मॉडल के लिए तकनीकी रिपोर्ट जारी की है, जो शक्तिशाली विभेदन और दक्षता प्राप्त करने के लिए बड़े पैमाने पर कंट्रास्टिव प्री-ट्रेनिंग को लेटेन्ट रीजनिंग के साथ जोड़ता है।

  • दो चरणों में प्रशिक्षित: चरण 1 कंट्रास्टिव प्री-ट्रेनिंग के माध्यम से एक एकीकृत मल्टीमोडल एम्बेडिंग स्पेस स्थापित करता है, जबकि चरण 2 अर्थव्यापकता को बढ़ाने के लिए इविडेंस-ग्राउंडेड टाइप्ड लेटेन्ट रीजनिंग और क्रॉस-कंडीशनल रिकंस्ट्रक्शन का उपयोग करता है।
  • दोनों तंत्र केवल प्रशिक्षण के दौरान कार्य करते हैं, जिससे DME मानक कंट्रास्टिव एनकोडर्स की तुलना में नगण्य क्वेरी-साइड ओवरहेड के साथ सेवा प्रदान कर सकता है।
  • MMEB-v2 पर, 2B और 9B वेरिएंट शीर्ष परिणाम प्राप्त करते हैं, जिनके स्कोर क्रमशः 74.8 और 78.4 हैं, जो वीडियो और विजुअल-डॉक्यूमेंट कार्यों में विशेष रूप से मजबूत प्रदर्शन दिखाते हैं।
  • उत्पादन में, DME ने डौइयां के ऑफलाइन इवैल्यूएशन सेट पर 2.92% सापेक्ष लाभ और खोज के लिए ऑनलाइन A/B टेस्टिंग में 0.1% लाइफटाइम (LT) लाभ प्रदान किया।

मॉडल को जनरेटिव, इमेज और AI सर्च सहित डौइयां के विभिन्न परिदृश्यों में तैनात किया गया है, जो अरब-पैमाने वाले इंडेक्सिंग के तहत दक्षता और सूक्ष्म विभेदन दोनों की आवश्यकता को पूरा करता है।