Исследователи представляют NeoMME, семейство из 260M и 800M многоязычных мультимодальных энкодеров, которые обрабатывают текст и сырые изображения с помощью одного двунаправленного Transformer. В отличие от генеративных визуальных языковых моделей, NeoMME не полагается на отдельные предварительно обученные визуальные башни или каузальные декодеры, обучая всю модель с нуля с использованием маскированного дискретного диффузионного объекта.

  • NeoMME-Retriever, дообученный для поиска визуальных документов, возвращает как плотные, так и поздние взаимодействия в одном прямом проходе.
  • Модель 260M достигает nDCG@10 равного 0.523 на ViDoRe v3, находясь на границе Парето при использовании значительно меньшего количества параметров по сравнению с аналогичными моделями.
  • Иерархическая пуллизация токенов и асимметричное квантование уменьшают объем хранения индекса позднего взаимодействия примерно с 1.5 MB до 6 kB на страницу, сохраняя более 95% качества базового поиска.

На GPU NVIDIA L40S модель 260M кодирует около 51 страницы в секунду при разрешении 2048×2048, предлагая почти вдвое большую пропускную способность по сравнению с ColModernVBERT.

Модели доступны в Hugging Face Transformers под лицензией Apache 2.0, что позволяет эффективно индексировать и искать мультимодальные корпуса без предварительной обработки OCR.