Tencent ha lanzado EVIE-Preview-4.5B, un modelo de Recuperación Visual de Documentos (VDR) multilingüe de última generación basado en Qwen3.5-4B. El modelo emplea interacción tardía al estilo ColBERT con incrustaciones de tokens multi-vectoriales nativas de 128 dimensiones para lograr un rendimiento de primer nivel en las pruebas ViDoRe.
- Supera a modelos más grandes de 8B en ViDoRe V3, liderando en 7 de los 8 dominios públicos.
- Ofrece una precisión promedio de 85.93 nDCG@5 en ViDoRe V1+V2.
- Soporta una generalización robusta sin ejemplos (zero-shot) en diversos idiomas (EN, FR, DE, IT, ES, PT, ZH) y formatos visuales.
- Totalmente integrado con el ecosistema estándar de colpali-engine para tuberías de puntuación de interacción tardía.
El modelo se entrena con aproximadamente 0.8 millones de pares de imagen-pregunta de alta calidad y utiliza minería dinámica y verificación para refinar la calidad de los datos de entrenamiento.