Pesquisadores apresentam o NeoMME, uma família de codificadores multimodais multilíngues de 260M e 800M que processam texto e patches de imagem brutos usando um único Transformer bidirecional. Diferente dos modelos de linguagem visual generativos, o NeoMME não depende de torres de visão pré-treinadas separadas ou decodificadores causais, treinando todo o modelo do zero com um objetivo de difusão discreta mascarada.

  • O NeoMME-Retriever ajustado para recuperação de documentos visuais retorna embeddings densos e de interação tardia em uma única passagem direta.
  • O modelo de 260M atinge um nDCG@10 de 0.523 no ViDoRe v3, posicionando-se na fronteira de Pareto enquanto usa significativamente menos parâmetros do que modelos comparáveis.
  • O agrupamento hierárquico de tokens e a quantização assimétrica reduzem o armazenamento do índice de interação tardia de aproximadamente 1,5 MB para 6 kB por página, mantendo mais de 95% da qualidade de recuperação da linha de base.
  • Em uma GPU NVIDIA L40S, o modelo de 260M codifica cerca de 51 páginas por segundo na resolução de 2048×2048, oferecendo quase o dobro da taxa de transferência do ColModernVBERT.

Os modelos estão disponíveis no Hugging Face Transformers sob a licença Apache 2.0, permitindo indexação e busca eficientes para corpora multimodais sem pré-processamento OCR.