연구자들은 텍스트와 원시 이미지 패치를 단일 양방향 Transformer로 처리하는 260M 및 800M 다국어 다중모달 인코더 계열인 NeoMME를 소개합니다. 생성형 시각 언어 모델과 달리 NeoMME는 별도의 사전 학습된 비전 타워나 인과적 디코더에 의존하지 않으며, 마스킹 이산 확산 목적 함수로 전체 모델을 처음부터 훈련합니다.

  • 시각 문서 검색을 위해 파인튜닝된 NeoMME-Retriever은 한 번의 순전파에서 밀집 및 후기 상호작용 임베딩을 모두 반환합니다.
  • 260M 모델은 ViDoRe v3에서 nDCG@10 점수 0.523을 달성하며, 유사한 모델보다 훨씬 적은 매개변수를 사용하면서 파레토 최적 경위에 위치합니다.
  • 계층적 토큰 풀링과 비대칭 양자화는 기본 검색 품질의 95% 이상을 유지하면서 페이지당 후기 상호작용 인덱스 저장량을 약 1.5 MB에서 6 kB로 줄입니다.
  • NVIDIA L40S GPU에서 260M 모델은 2048×2048 해상도로 초당 약 51페이지를 인코딩하며, ColModernVBERT보다 거의 두 배의 처리량을 제공합니다.

이 모델들은 Apache 2.0 라이선스 하에 Hugging Face Transformers에서 사용 가능하며, OCR 전처리 없이 다중모달 코퍼스의 효율적인 인덱싱과 검색을 가능하게 합니다.