शोधकर्ताओं ने NeoMME का परिचय दिया, जो 260M और 800M बहुभाषी बहुआयामी एन्कोडर्स का एक परिवार है जो एकल द्विदिशात्मक Transformer का उपयोग करके पाठ और कच्चे छवि पैचों को प्रोसेस करता है। जनरेटिव विज़ुअल लैंग्वेज मॉडल्स के विपरीत, NeoMME अलग-अलग प्रीट्रेन्डेड विज़न टावर या कैज़ुअल डिकोडर्स पर निर्भर नहीं करता है, और पूरे मॉडल को एक मास्क्ड डिस्क्रीट-डिफ्यूजन ऑब्जेक्टिव के साथ शून्य से प्रशिक्षित करता है।
- NeoMME-Retriever विज़ुअल दस्तावेज़ रीट्रीवल के लिए फाइन-ट्यून किया गया है, जो एक फॉरवर्ड पास में घने और देर-इंटरैक्शन एम्बेडिंग्स दोनों लौटाता है।
- 260M मॉडल ViDoRe v3 पर 0.523 का nDCG@10 प्राप्त करता है, जो पारेटो फ्रंटियर पर स्थित है और तुलनीय मॉडल्स की तुलना में काफी कम पैरामीटर का उपयोग करते हुए।
- हिएरार्किकल टोकन पूलिंग और असममित क्वांटीज़ेशन देर-इंटरैक्शन इंडेक्स भंडारण को लगभग 1.5 MB से कम करके 6 kB प्रति पेज बना देते हैं, जबकि बेलाइन रीट्रीवल गुणवत्ता का 95% से अधिक बनाए रखते हैं।
- NVIDIA L40S GPU पर, 260M मॉडल 2048×2048 रिज़ोल्यूशन पर प्रति सेकंड लगभग 51 पेज एन्कोड करता है, जो ColModernVBERT की तुलना में लगभग दोगुनी थ्रूपुट प्रदान करता है।
मॉडल्स Apache 2.0 लाइसेंस के तहत Hugging Face Transformers के तहत उपलब्ध हैं, जिससे OCR पूर्व-प्रोसेसिंग के बिना बहुआयामी कॉर्परा के लिए कुशल इंडेक्सिंग और खोज संभव होती है।