Tencent telah merilis EVIE-4.5B, model pengambilan dokumen visual multibahasa berkinerja tinggi yang menampilkan Prefix-Multivector Retrieval Latency (Prefix-MRL) dinamis dan kompresi token Hierarchical Agglomerative Clustering (HAC) tanpa pelatihan.
- EVIE-4.5B mencapai skor 66.02 pada ViDoRe V3 Public menggunakan Prefix-MRL proyeksi tunggal, sementara varian EVIE-8B yang lebih besar meraih skor 66.75.
- Model ini mendukung pemotongan dimensi saat runtime dari 2048D hingga 64D tanpa memerlukan model terpisah, mempertahankan akurasi pengambilan tinggi di semua ukuran.
- HAC tanpa pelatihan memadatkan jumlah token dari sekitar 750 vektor per halaman menjadi 32, mengurangi penyimpanan indeks menjadi 3.81 GiB per juta halaman.
- Model dievaluasi pada 138 tugas multibahasa di ViDoRe V1, V2, V3, dan JinaVDR, menunjukkan kinerja kuat dalam bahasa Inggris, Prancis, Jerman, Spanyol, Arab, dan Mandarin.
- EVIE-4.5B didistilasi dari guru EVIE-8B menggunakan resep EVIE-ARD, yang menerapkan distilasi relasi pelestari jangkar dan sadar kapasitas.
Rilis ini menyediakan solusi fleksibel untuk pengambilan dokumen visual yang menyeimbangkan presisi tinggi dengan kebutuhan penyimpanan yang secara signifikan berkurang melalui dimensi embedding dinamis dan kompresi token.