La biblioteca Sentence Transformers introduce MultiVectorEncoder, un componente que permite el entrenamiento y ajuste fino de modelos de incrustación multi-vector que utilizan recuperación de interacción tardía. Esta adición permite a los usuarios construir modelos multi-vector sólidos desde cero o adaptar los existentes a dominios específicos sin depender de recuperadores de propósito general.
- La implementación soporta arquitecturas estilo ColBERT donde la coincidencia a nivel de token preserva señales finas para un mejor rendimiento de recuperación.
- Los usuarios pueden ajustar checkpoints existentes como mLateOn-unsupervised o inicializar modelos nuevos utilizando transformadores base como ModernBERT.
- El entrenamiento requiere componentes específicos incluyendo conjuntos de datos, funciones de pérdida y evaluadores, con soporte para formatos del Hugging Face Datasets Hub.
- El autor demuestra que el ajuste fino en datos médicos supera a los modelos densos, dispersos y léxicos de propósito general.
Este enfoque permite la adaptación específica del dominio en horas en hardware de consumo, abordando las limitaciones de los documentos truncados en modelos de recuperación estándar.