يقدم الباحثون NeoMME، وهو مجموعة من المشفرات متعددة الوسائط متعددة اللغات بحجم 260M و800M تعالج النص ومقاطع الصور الخام باستخدام محوّل ثنائي الاتجاه واحد. وعلى عكس نماذج اللغة البصرية التوليدية، لا يعتمد NeoMME على أبراج رؤية مُدرَّبة مسبقاً بشكل منفصل أو فكوك سببية، بل يتم تدريب النموذج بأكمله من الصفر باستخدام هدف الانتشار المنفصل المقنع.
- يُعاد ضبط NeoMME-Retriever للاسترجاع الوثائقي البصري ليعطي كل من التضمينات الكثيفة وتضمينات تأخير التفاعل في تمرير أمامي واحد.
- يحقق النموذج ذو 260M معامل nDCG@10 بقيمة 0.523 على ViDoRe v3، مما يضعه على حدود باريتو بينما يستخدم عدد معاملات أقل بكثير مقارنة بالنماذج المماثلة.
- تقلل التجميع الهرمي للرموز والكمية غير المتماثلة من مساحة تخزين فهرس تأخير التفاعل من حوالي 1.5 ميجابايت إلى 6 كيلوبايت لكل صفحة مع الحفاظ على أكثر من 95% من جودة الاسترجاع الأساسية.
- على بطاقة NVIDIA L40S GPU، يقوم النموذج ذو 260M بتشفير حوالي 51 صفحة في الثانية بدقة 2048×2048، مما يوفر معدل إخراج يقارب ضعف ColModernVBERT.
النماذج متاحة في Hugging Face Transformers بموجب رخصة Apache 2.0، مما يتيح فهرسة وبحثاً فعّالاً للمجموعات متعددة الوسائط دون الحاجة إلى معالجة مسبقة باستخدام التعرف الضوئي على الحروف (OCR).