La bibliothèque Sentence Transformers introduit MultiVectorEncoder, un composant permettant l'entraînement et le fine-tuning de modèles d'embedding multi-vecteurs qui utilisent la récupération à interaction tardive. Cette addition permet aux utilisateurs de construire des modèles multi-vecteurs performants à partir de zéro ou d'adapter des modèles existants à des domaines spécifiques sans dépendre de récupérateurs à usage général.
- L'implémentation prend en charge les architectures de style ColBERT où la correspondance au niveau des tokens préserve les signaux fins pour une meilleure performance de récupération.
- Les utilisateurs peuvent effectuer un fine-tuning sur des checkpoints existants comme mLateOn-unsupervised ou initialiser de nouveaux modèles en utilisant des transformateurs de base tels que ModernBERT.
- L'entraînement nécessite des composants spécifiques incluant des jeux de données, des fonctions de perte et des évaluateurs, avec prise en charge des formats du Hub Hugging Face Datasets.
- L'auteur démontre que le fine-tuning sur des données médicales surpasse les modèles denses, clairsemés et lexicaux à usage général.
Cette approche permet une adaptation spécifique au domaine en quelques heures sur du matériel grand public, répondant aux limitations des documents tronqués dans les modèles de récupération standard.