研究人员推出了NeoMME,这是一系列包含260M和800M参数的多语言多模态编码器,使用单个双向Transformer处理文本和原始图像块。与生成式视觉语言模型不同,NeoMME不依赖独立的预训练视觉塔或因果解码器,而是通过掩码离散扩散目标从头开始训练整个模型。
- 针对视觉文档检索微调的NeoMME-Retriever在一次前向传播中同时返回密集和晚期交互嵌入。
- 260M模型在ViDoRe v3上取得了0.523的nDCG@10分数,处于帕累托前沿,且参数量显著少于同类模型。
- 分层标记池化和非对称量化将晚期交互索引存储从每页约1.5 MB减少到6 kB,同时保留了基线检索质量的95%以上。
- 在NVIDIA L40S GPU上,260M模型以2048×2048分辨率每秒编码约51页,吞吐量几乎是ColModernVBERT的两倍。
这些模型在Hugging Face Transformers中以Apache 2.0许可证提供,使得无需OCR预处理即可高效地对多模态语料库进行索引和搜索。