Tencent a publié EVIE-4.5B, un modèle de récupération visuelle de documents multilingues haute performance présentant une latence de récupération multivectorielle par préfixe dynamique (Prefix-MRL) et une compression de tokens par regroupement hiérarchique agglomératif (HAC) sans entraînement.

  • EVIE-4.5B atteint 66,02 sur ViDoRe V3 Public en utilisant un Prefix-MRL à projection unique, tandis que la variante plus grande EVIE-8B obtient 66,75.
  • Le modèle prend en charge le tronçonnage de dimension en temps réel de 2048D à 64D sans nécessiter de modèles séparés, maintenant une haute précision de récupération pour toutes les tailles.
  • Le HAC sans entraînement réduit le nombre de tokens d'environ 750 vecteurs par page à 32, diminuant le stockage d'index à 3,81 GiB par million de pages.
  • Le modèle a été évalué sur 138 tâches multilingues sur ViDoRe V1, V2, V3 et JinaVDR, démontrant des performances solides en anglais, français, allemand, espagnol, arabe et chinois.
  • EVIE-4.5B est distillé à partir du professeur EVIE-8B en utilisant la recette EVIE-ARD, qui emploie une distillation de relation préservant les ancres et consciente de la capacité.

La publication offre une solution flexible pour la récupération visuelle de documents qui équilibre une haute précision avec des exigences de stockage considérablement réduites grâce à des dimensions d'embedding dynamiques et une compression de tokens.