Tencentは、動的Prefix-Multivector Retrieval Latency(Prefix-MRL)とトレーニング不要のHierarchical Agglomerative Clustering(HAC)トークン圧縮を搭載した高性能な多言語視覚文書検索モデルであるEVIE-4.5Bをリリースしました。
- EVIE-4.5Bは、単一射影のPrefix-MRLを使用してViDoRe V3 Publicで66.02のスコアを達成し、より大規模なEVIE-8Bバリアントは66.75のスコアを記録しています。
- このモデルは、個別のモデルを必要とせずに2048Dから64Dへのランタイム次元切り捨てをサポートしており、すべてのサイズで高い検索精度を維持します。
- トレーニング不要のHACにより、1ページあたりのトークン数が約750ベクトルから32に圧縮され、インデックスのストレージは100万ページあたり3.81 GiBに削減されます。
- このモデルはViDoRe V1、V2、V3、およびJinaVDRで138の多言語タスクにわたって評価され、英語、フランス語、ドイツ語、スペイン語、アラビア語、中国語において強力なパフォーマンスを示しました。
- EVIE-4.5Bは、アンカー保持型・容量対応関係蒸留を採用したEVIE-ARDレシピを使用して、EVIE-8B教師モデルから蒸留されています。
このリリースは、動的埋め込み次元とトークン圧縮を通じて高い精度と大幅に削減されたストレージ要件のバランスを取る、視覚文書検索のための柔軟なソリューションを提供します。