Los investigadores presentan NeoMME, una familia de codificadores multimodales multilingües de 260M y 800M que procesan texto y parches de imagen crudos utilizando un único Transformer bidireccional. A diferencia de los modelos de lenguaje visual generativos, NeoMME no depende de torres visuales preentrenadas por separado ni de decodificadores causales; entrena todo el modelo desde cero con un objetivo de difusión discreta enmascarada.
- NeoMME-Retriever ajustado para la recuperación de documentos visuales devuelve tanto incrustaciones densas como de interacción tardía en una sola pasada hacia adelante.
- El modelo de 260M alcanza un nDCG@10 de 0.523 en ViDoRe v3, situándose en la frontera de Pareto mientras utiliza significativamente menos parámetros que los modelos comparables.
- El agrupamiento jerárquico de tokens y la cuantización asimétrica reducen el almacenamiento del índice de interacción tardía de aproximadamente 1.5 MB a 6 kB por página, conservando más del 95% de la calidad de recuperación de referencia.
- En una GPU NVIDIA L40S, el modelo de 260M codifica unas 51 páginas por segundo a una resolución de 2048×2048, ofreciendo casi el doble de rendimiento que ColModernVBERT.
Los modelos están disponibles en Hugging Face Transformers bajo la licencia Apache 2.0, lo que permite una indexación y búsqueda eficientes para corpus multimodales sin preprocesamiento OCR.