أصدرت دويين التقرير التقني لنموذج التضمين متعدد الوسائط (DME)، الذي يجمع بين التدريب المسبق التبايني واسع النطاق والاستنتاج الضمني لتحقيق تمييز وكفاءة قويين.

  • تم التدريب في مرحلتين: المرحلة الأولى تُنشئ مساحة تضمين متعددة الوسائط موحدة عبر التدريب المسبق التبايني، بينما تستخدم المرحلة الثانية الاستنتاج الضمني الموثق بالأدلة والمعتمد على الأنواع وإعادة البناء عبر الشروط المتقاطعة لتعزيز كفاية المعنى.
  • تعمل كلتا الآليتين فقط أثناء التدريب، مما يتيح لـ DME العمل بعبء إضافي ضئيل على جانب الاستعلام يقارب الترميزات التباينية القياسية.
  • على مجموعة MMEB-v2، حققت نسختا 2B و9B نتائج متفوقة بنتيجتي 74.8 و78.4، مع قوة خاصة في مهام الفيديو والمستندات البصرية.
  • في الإنتاج، حقق DME مكسباً نسبياً بنسبة 2.92% على مجموعة التقييم غير المتزامن لديويين، ومكسباً بنسبة 0.1% في العمر الافتراضي (LT) في اختبار A/B عبر الإنترنت للبحث.

تم نشر النموذج عبر سيناريوهات دويين بما في ذلك التوليدية والصورية والبحث المدعوم بالذكاء الاصطناعي، مما يلبي الحاجة إلى الكفاءة تحت فهرسة بمقياس المليار والتمييز الدقيق.