Les chercheurs présentent NeoMME, une famille d'encodeurs multimodaux multilingues de 260M et 800M paramètres qui traitent le texte et les patches d'image bruts à l'aide d'un seul Transformer bidirectionnel. Contrairement aux modèles de langage visuel génératifs, NeoMME ne repose pas sur des tours de vision pré-entraînés séparés ou des décodeurs causaux ; il est entraîné entièrement从零 avec un objectif de diffusion discrète masquée.
- NeoMME-Retriever, affiné pour la récupération de documents visuels, renvoie à la fois des embeddings denses et tardifs en un seul passage avant.
- Le modèle 260M atteint un nDCG@10 de 0.523 sur ViDoRe v3, se situant sur la frontière de Pareto tout en utilisant significativement moins de paramètres que les modèles comparables.
- Le regroupement hiérarchique de tokens et la quantification asymétrique réduisent le stockage de l'index d'interaction tardive d'environ 1,5 Mo à 6 Ko par page tout en conservant plus de 95 % de la qualité de récupération de base.
- Sur un GPU NVIDIA L40S, le modèle 260M encode environ 51 pages par seconde à une résolution de 2048×2048, offrant un débit presque deux fois supérieur à celui de ColModernVBERT.
Les modèles sont disponibles dans Hugging Face Transformers sous la licence Apache 2.0, permettant une indexation et une recherche efficaces pour les corpus multimodaux sans prétraitement par OCR.