Tencent ha lanzado EVIE-8B, un modelo de recuperación visual de documentos de alta capacidad que cuenta con representaciones de tokens de 4096 dimensiones y atención bidireccional completa. El modelo sirve como base para la variante ligera EVIE-4.5B Prefix-MRL y alcanza un rendimiento de vanguardia en benchmarks de recuperación visual de documentos.

  • Alcanza 66.75 nDCG@10 en ViDoRe V3 Public, ofreciendo precisión líder en la industria.
  • Proporciona incrustaciones multi-vectoriales por token que preservan el diseño fino, la tipografía, los gráficos y las estructuras de tablas.
  • Validado en 138 tareas en ViDoRe V1, V2, V3 y JinaVDR utilizando cuatro familias de métricas estándar.
  • Entrenado con 775.635 pares de documento-pregunta con negativos difíciles extraídos y clasificados en categorías respondibles, ambiguas estrictas.

El lanzamiento incluye los pesos del modelo, el motor de inferencia y el conjunto de evaluación bajo una licencia Apache-2.0 para facilitar la recuperación visual de documentos de alta fidelidad.