تقدم مكتبة Sentence Transformers مكونًا جديدًا يُدعى MultiVectorEncoder، وهو عنصر يمكّن من تدريب وضبط نماذج التضمين متعددة المتجهات التي تستخدم الاسترجاع بالتفاعل المتأخر. يتيح هذا الإضافة للمستخدمين بناء نماذج قوية متعددة المتجهات من الصفر أو تكييف النماذج الموجودة مع مجالات محددة دون الاعتماد على مسترجعات الأغراض العامة.
- يدعم التنفيذ بنية ColBERT حيث يحافظ المطابقة على مستوى الرمز على إشارات دقيقة لأداء استرجاع أقوى.
- يمكن للمستخدمين ضبط نقاط التفتيش الموجودة مثل mLateOn-unsupervised أو تهيئة نماذج جديدة باستخدام محولات أساسية مثل ModernBERT.
- يتطلب التدريب مكونات محددة بما في ذلك مجموعات البيانات ودوال الخسارة والمقيّمين، مع دعم تنسيقات Hugging Face Datasets Hub.
- يوضح المؤلف أن الضبط على البيانات الطبية يتفوق على النماذج الكثيفة والعرضية والлексية ذات الأغراض العامة.
يتيح هذا النهج التكيف المحدد للمجال في ساعات على الأجهزة الاستهلاكية، مما يعالج قيود الوثائق المقطوعة في نماذج الاسترجاع القياسية.