Tencent a publié EVIE-Preview-4.5B, un modèle de pointe de Recherche de Documents Visuels (VDR) multilingue basé sur Qwen3.5-4B. Le modèle utilise une interaction tardive de style ColBERT avec des embeddings de tokens multi-vecteurs natifs de dimension 128 pour atteindre des performances de premier plan sur les benchmarks ViDoRe.

  • Surpasse les modèles plus grands de 8 milliards de paramètres sur ViDoRe V3, en tête dans 7 domaines publics sur 8.
  • Offre une précision moyenne de 85,93 nDCG@5 sur ViDoRe V1+V2.
  • Prend en charge une généralisation robuste zéro-shot à travers diverses langues (EN, FR, DE, IT, ES, PT, ZH) et formats visuels.
  • Entièrement intégré à l'écosystème standard colpali-engine pour les pipelines de score par interaction tardive.

Le modèle est entraîné sur environ 0,8 million de paires image-requête de haute qualité et utilise le mining dynamique et la vérification pour affiner la qualité des données d'entraînement.