Библиотека Sentence Transformers представляет MultiVectorEncoder — компонент, позволяющий обучать и дообучать многовекторные модели встраиваний, использующие позднее взаимодействие при поиске. Это дополнение позволяет пользователям создавать мощные многовекторные модели с нуля или адаптировать существующие под конкретные области без опоры на универсальные системы поиска.
- Реализация поддерживает архитектуры в стиле ColBERT, где сопоставление на уровне токенов сохраняет детализированные сигналы для более эффективного поиска.
- Пользователи могут дообучать существующие контрольные точки, такие как mLateOn-unsupervised, или инициализировать новые модели с помощью базовых трансформеров, таких как ModernBERT.
- Обучение требует специфических компонентов, включая наборы данных, функции потерь и оценщики, с поддержкой форматов Hugging Face Datasets Hub.
- Автор демонстрирует, что дообучение на медицинских данных превосходит универсальные плотные, разреженные и лексические модели.
Этот подход позволяет адаптировать модель под конкретную область за часы на потребительском оборудовании, устраняя ограничения усечённых документов в стандартных моделях поиска.