टेंसेंट ने Qwen3.5-4B पर आधारित एक अत्याधुनिक बहुभाषी Visual Document Retrieval (VDR) मॉडल EVIE-Preview-4.5B जारी किया है। शीर्ष स्तर की प्रदर्शन को हासिल करने के लिए, इस मॉडल में ColBERT-शैली का देर से इंटरैक्शन और स्थानीय 128-आयामी बहु-वेक्टर टोकन एम्बेडिंग्स शामिल हैं।

  • ViDoRe V3 पर बड़े 8B मॉडलों को हराकर, 8 सार्वजनिक डोमेनों में से 7 में अग्रस्थान हासिल किया।
  • ViDoRe V1+V2 पर 85.93 nDCG@5 की औसत सटीकता प्रदान करता है।
  • विविध भाषाओं (EN, FR, DE, IT, ES, PT, ZH) और दृश्य प्रारूपों में मजबूत जीरो-शॉट सामान्यीकरण का समर्थन करता है।
  • देर से इंटरैक्शन स्कोरिंग पाइपलाइनों के लिए मानक colpali-engine इकोसिस्टम के साथ पूरी तरह एकीकृत है।

इस मॉडल को लगभग 0.8 मिलियन उच्च-गुणवत्ता वाली छवि-क्वेरी जोड़ों पर प्रशिक्षित किया गया है और यह प्रशिक्षण डेटा की गुणवत्ता को परिष्कृत करने के लिए गतिशील खनन और सत्यापन का उपयोग करता है।