Tencent ha lanzado EVIE-4.5B, un modelo de recuperación visual de documentos multilingüe de alto rendimiento que cuenta con Recuperación de Latencia Multivectorial Dinámica de Prefijo (Prefix-MRL) y compresión de tokens mediante Agrupamiento Aglomerativo Jerárquico (HAC) sin necesidad de entrenamiento.

  • EVIE-4.5B alcanza 66.02 en ViDoRe V3 Public utilizando un Prefix-MRL de proyección única, mientras que la variante más grande EVIE-8B obtiene 66.75.
  • El modelo soporta truncamiento de dimensión en tiempo de ejecución desde 2048D hasta 64D sin requerir modelos separados, manteniendo alta precisión de recuperación en todos los tamaños.
  • HAC sin entrenamiento comprime el número de tokens desde aproximadamente 750 vectores por página hasta 32, reduciendo el almacenamiento del índice a 3.81 GiB por millón de páginas.
  • El modelo fue evaluado en 138 tareas multilingües en ViDoRe V1, V2, V3 y JinaVDR, demostrando un rendimiento sólido en inglés, francés, alemán, español, árabe y chino.
  • EVIE-4.5B es destilado del maestro EVIE-8B utilizando la receta EVIE-ARD, que emplea destilación de relaciones con conciencia de capacidad y preservación de anclas.

El lanzamiento proporciona una solución flexible para la recuperación visual de documentos que equilibra alta precisión con requisitos de almacenamiento significativamente reducidos mediante dimensiones de incrustación dinámicas y compresión de tokens.