A Tencent lançou o EVIE-8B, um modelo de recuperação visual de documentos de alta capacidade que apresenta representações de tokens em 4096 dimensões e atenção bidirecional completa. O modelo serve como base para a variante leve EVIE-4.5B Prefix-MRL e alcança desempenho de ponta em benchmarks de recuperação visual de documentos.
- Alcança 66,75 nDCG@10 no ViDoRe V3 Public, oferecendo precisão líder do setor.
- Fornece embeddings vetoriais múltiplos por token que preservam detalhes finos de layout, tipografia, gráficos e estruturas de tabelas.
- Validado em 138 tarefas no ViDoRe V1, V2, V3 e JinaVDR usando quatro famílias padrão de métricas.
- Treinado com 775.635 pares de documento-pesquisa com negativos difíceis extraídos e classificados nas categorias respondível, ambíguo e estrito.
O lançamento inclui os pesos do modelo, o mecanismo de inferência e a estrutura de avaliação sob uma licença Apache-2.0 para facilitar a recuperação visual de documentos de alta fidelidade.