Pustaka Sentence Transformers memperkenalkan MultiVectorEncoder, sebuah komponen yang memungkinkan pelatihan dan penyetelan ulang model embedding multi-vektor yang memanfaatkan pengambilan hasil dengan interaksi akhir. Penambahan ini memungkinkan pengguna membangun model multi-vektor kuat dari awal atau menyesuaikan model yang sudah ada ke domain tertentu tanpa bergantung pada retriever tujuan umum.
- Implementasi mendukung arsitektur gaya ColBERT di mana pencocokan tingkat token mempertahankan sinyal halus untuk kinerja pengambilan hasil yang lebih baik.
- Pengguna dapat menyetel ulang checkpoint yang sudah ada seperti mLateOn-unsupervised atau menginisialisasi model baru menggunakan transformer dasar seperti ModernBERT.
- Pelatihan memerlukan komponen khusus termasuk dataset, fungsi kerugian, dan evaluator, dengan dukungan untuk format Hugging Face Datasets Hub.
- Penulis menunjukkan bahwa penyetelan ulang pada data medis lebih unggul dibandingkan model dense, sparse, dan leksikal tujuan umum.
Pendekatan ini memungkinkan adaptasi spesifik domain dalam hitungan jam pada perangkat konsumen, mengatasi keterbatasan dokumen terpotong pada model pengambilan hasil standar.