Para peneliti memperkenalkan NeoMME, sebuah keluarga encoder multimodal multilingual berukuran 260M dan 800M yang memproses teks dan patch gambar mentah menggunakan satu Transformer bidirectional. Berbeda dengan model bahasa visual generatif, NeoMME tidak bergantung pada menara visi pretrained terpisah atau decoder kausal, melainkan melatih seluruh model dari awal dengan tujuan discrete-diffusion termaskir.
- NeoMME-Retriever yang di-fine-tune untuk retrieval dokumen visual mengembalikan embedding dense dan late-interaction dalam satu forward pass.
- Model 260M mencapai nDCG@10 sebesar 0.523 pada ViDoRe v3, berada di Pareto frontier sambil menggunakan parameter jauh lebih sedikit dibandingkan model sebanding.
- Hierarchical token pooling dan asymmetric quantization mengurangi penyimpanan indeks late-interaction dari sekitar 1,5 MB menjadi 6 kB per halaman sambil mempertahankan lebih dari 95% kualitas retrieval baseline.
- Pada GPU NVIDIA L40S, model 260M mengkodekan sekitar 51 halaman per detik pada resolusi 2048×2048, menawarkan throughput hampir dua kali lipat dibandingkan ColModernVBERT.
Model-model ini tersedia di Hugging Face Transformers di bawah lisensi Apache 2.0, memungkinkan indexing dan pencarian efisien untuk korpus multimodal tanpa pra-pemrosesan OCR.