Tencent a publié EVIE-8B, un modèle de récupération de documents visuels à haute capacité présentant des représentations de tokens en 4096 dimensions et une attention bidirectionnelle complète. Le modèle sert de base enseignante pour la variante légère EVIE-4.5B Prefix-MRL et atteint des performances de pointe sur les benchmarks de récupération de documents visuels.
- Atteint un nDCG@10 de 66,75 sur ViDoRe V3 Public, offrant une précision leader dans l'industrie.
- Fournit des embeddings multi-vecteurs par token complets qui préservent la mise en page fine-grained, la typographie, les graphiques et les structures de tableaux.
- Validé sur 138 tâches dans ViDoRe V1, V2, V3 et JinaVDR à l'aide de quatre familles de métriques standard.
- Entraîné sur 775 635 paires document-requête avec des négatifs difficiles extraits et classés en catégories répondables, ambiguës et strictes.
La publication inclut les poids du modèle, le moteur d'inférence et le harnais d'évaluation sous licence Apache-2.0 pour faciliter la récupération de documents visuels haute fidélité.