텐센트는 동적 Prefix-Multivector Retrieval Latency(Prefix-MRL)와 학습 불필요한 Hierarchical Agglomerative Clustering(HAC) 토큰 압축을 특징으로 하는 고성능 다국어 시각 문서 검색 모델인 EVIE-4.5B를 출시했습니다.

  • EVIE-4.5B는 단일 투영 Prefix-MRL을 사용하여 ViDoRe V3 Public에서 66.02의 점수를 달성했으며, 더 큰 EVIE-8B 변형 모델은 66.75점을 기록했습니다.
  • 이 모델은 별도의 모델 없이 2048D에서 64D까지 런타임 차원 축소를 지원하며, 모든 크기에서 높은 검색 정확도를 유지합니다.
  • 학습 불필요한 HAC는 페이지당 약 750개의 벡터에서 32개로 토큰 수를 압축하여 인덱스 저장 공간을 백만 페이지당 3.81 GiB로 줄입니다.
  • 이 모델은 ViDoRe V1, V2, V3 및 JinaVDR의 138개 다국어 작업에 걸쳐 평가되었으며, 영어, 프랑스어, 독일어, 스페인어, 아랍어, 중국어에서 강력한 성능을 보였습니다.
  • EVIE-4.5B는 앵커 보존 및 용량 인식 관계 증류(EVIE-ARD) 레시피를 사용하여 EVIE-8B 교사 모델로부터 증류되었습니다.

이번 출시는 동적 임베딩 차원과 토큰 압축을 통해 높은 정밀도와 크게 줄어든 저장 요구 사항 사이의 균형을 맞추는 시각 문서 검색을 위한 유연한 솔루션을 제공합니다.