Библиотека Sentence Transformers представляет MultiVectorEncoder — компонент, позволяющий обучать и дообучать многовекторные модели встраиваний, использующие позднее взаимодействие при поиске. Это дополнение позволяет пользователям создавать мощные многовекторные модели с нуля или адаптировать существующие под конкретные области без опоры на универсальные системы поиска.

  • Реализация поддерживает архитектуры в стиле ColBERT, где сопоставление на уровне токенов сохраняет детализированные сигналы для более эффективного поиска.
  • Пользователи могут дообучать существующие контрольные точки, такие как mLateOn-unsupervised, или инициализировать новые модели с помощью базовых трансформеров, таких как ModernBERT.
  • Обучение требует специфических компонентов, включая наборы данных, функции потерь и оценщики, с поддержкой форматов Hugging Face Datasets Hub.
  • Автор демонстрирует, что дообучение на медицинских данных превосходит универсальные плотные, разреженные и лексические модели.

Этот подход позволяет адаптировать модель под конкретную область за часы на потребительском оборудовании, устраняя ограничения усечённых документов в стандартных моделях поиска.