텐센트는 Qwen3.5-4B을 기반으로 구축된 최첨단 다국어 시각 문서 검색(VDR) 모델인 EVIE-Preview-4.5B를 출시했습니다. 이 모델은 ColBERT 스타일의 후기 상호작용과 네이티브 128차원 다중 벡터 토큰 임베딩을 사용하여 ViDoRe 벤치마크 전반에서 최상위 성능을 달성합니다.
- ViDoRe V3에서 더 큰 8B 모델들을 압도하며 공개 도메인 8개 중 7개에서 선두를 차지합니다.
- ViDoRe V1+V2에서 평균 정확도 85.93 nDCG@5를 제공합니다.
- 다양한 언어(EN, FR, DE, IT, ES, PT, ZH)와 시각적 형식 전반에 걸쳐 강력한 제로샷 일반화를 지원합니다.
- 후기 상호작용 점수 파이프라인을 위해 표준 colpali-engine 생태계와 완전히 통합되었습니다.
이 모델은 약 80만 개의 고품질 이미지-쿼리 쌍으로 학습되었으며, 훈련 데이터의 품질을 정제하기 위해 동적 마이닝과 검증을 활용합니다.