A Tencent lançou o EVIE-4.5B, um modelo de recuperação visual multilíngue de documentos de alto desempenho que apresenta Prefix-Multivector Retrieval Latency (Prefix-MRL) dinâmico e compressão de tokens Hierarchical Agglomerative Clustering (HAC) sem treinamento.

  • O EVIE-4.5B alcança 66.02 no ViDoRe V3 Public usando um Prefix-MRL de projeção única, enquanto a variante maior EVIE-8B obtém pontuação de 66.75.
  • O modelo suporta truncamento de dimensão em tempo de execução de 2048D até 64D sem exigir modelos separados, mantendo alta precisão de recuperação em todos os tamanhos.
  • O HAC sem treinamento comprime a contagem de tokens de aproximadamente 750 vetores por página para 32, reduzindo o armazenamento do índice para 3.81 GiB por milhão de páginas.
  • O modelo foi avaliado em 138 tarefas multilíngues no ViDoRe V1, V2, V3 e JinaVDR, demonstrando forte desempenho em inglês, francês, alemão, espanhol, árabe e chinês.
  • O EVIE-4.5B é destilado do professor EVIE-8B usando a receita EVIE-ARD, que emprega destilação de relação com preservação de âncoras e consciência de capacidade.

O lançamento oferece uma solução flexível para recuperação visual de documentos que equilibra alta precisão com requisitos de armazenamento significativamente reduzidos por meio de dimensões de embedding dinâmicas e compressão de tokens.