Tencent telah merilis EVIE-Preview-4.5B, sebuah model Visual Document Retrieval (VDR) multibahasa mutakhir yang dibangun di atas Qwen3.5-4B. Model ini menerapkan interaksi akhir bergaya ColBERT dengan embedding token multivektor berdimensi 128 asli untuk mencapai kinerja puncak di berbagai benchmark ViDoRe.
- Mengungguli model berukuran 8B yang lebih besar pada ViDoRe V3, memimpin di 7 dari 8 domain publik.
- Memberikan akurasi rata-rata 85.93 nDCG@5 pada ViDoRe V1+V2.
- Mendukung generalisasi zero-shot yang kuat di berbagai bahasa (EN, FR, DE, IT, ES, PT, ZH) dan format visual.
- Terintegrasi sepenuhnya dengan ekosistem colpali-engine standar untuk pipa skor interaksi akhir.
Model ini dilatih pada sekitar 0,8 juta pasangan gambar-pertanyaan berkualitas tinggi dan memanfaatkan penambangan serta verifikasi dinamis untuk meningkatkan kualitas data pelatihan.