Tencent telah merilis EVIE-8B, model pengambilan dokumen visual berkapasitas tinggi yang menampilkan representasi token berdimensi 4096 dan perhatian penuh dua arah. Model ini berfungsi sebagai dasar pengajar untuk varian ringan EVIE-4.5B Prefix-MRL dan mencapai kinerja terbaik pada benchmark pengambilan dokumen visual.
- Mencapai nDCG@10 sebesar 66,75 pada ViDoRe V3 Public, memberikan akurasi terdepan industri.
- Menyediakan embedding multi-vektor per-token yang mempertahankan tata letak halus, tipografi, bagan, dan struktur tabel secara rinci.
- Tervalidasi di 138 tugas pada ViDoRe V1, V2, V3, dan JinaVDR menggunakan empat keluarga metrik standar.
- Dilatih pada 775.635 pasangan dokumen-pertanyaan dengan negatif keras yang ditambang dan diklasifikasikan ke dalam kategori dapat dijawab, ambigu, dan ketat.
Rilis ini mencakup bobot model, mesin inferensi, dan perangkat evaluasi di bawah lisensi Apache-2.0 untuk memfasilitasi pengambilan dokumen visual berketepatan tinggi.