A Tencent lançou o EVIE-Preview-4.5B, um modelo de ponta para Recuperação Visual de Documentos (VDR) multilíngue, construído sobre o Qwen3.5-4B. O modelo emprega interação tardia no estilo ColBERT com embeddings de tokens multi-vetoriais nativos de 128 dimensões para alcançar desempenho de topo nos benchmarks ViDoRe.

  • Supera modelos maiores de 8B no ViDoRe V3, liderando em 7 dos 8 domínios públicos.
  • Oferece uma precisão média de 85.93 nDCG@5 no ViDoRe V1+V2.
  • Suporta generalização robusta zero-shot em diversos idiomas (EN, FR, DE, IT, ES, PT, ZH) e formatos visuais.
  • Totalmente integrado ao ecossistema padrão do colpali-engine para pipelines de pontuação por interação tardia.

O modelo é treinado com aproximadamente 0,8 milhão de pares de imagem-pergunta de alta qualidade e utiliza mineração dinâmica e verificação para refinar a qualidade dos dados de treinamento.