A biblioteca Sentence Transformers apresenta o MultiVectorEncoder, um componente que permite o treinamento e o ajuste fino de modelos de incorporação multi-vector que utilizam recuperação por interação tardia. Esta adição permite que os usuários construam modelos multi-vector robustos do zero ou adaptem modelos existentes a domínios específicos sem depender de recuperadores de propósito geral.
- A implementação suporta arquiteturas estilo ColBERT, onde o correspondência em nível de token preserva sinais finos para um desempenho de recuperação mais forte.
- Os usuários podem ajustar finamente checkpoints existentes como mLateOn-unsupervised ou inicializar modelos novos usando transformadores base como ModernBERT.
- O treinamento requer componentes específicos, incluindo conjuntos de dados, funções de perda e avaliadores, com suporte para formatos do Hugging Face Datasets Hub.
- O autor demonstra que o ajuste fino em dados médicos supera modelos densos, esparsos e lexicais de propósito geral.
Esta abordagem permite a adaptação específica ao domínio em horas em hardware de consumo, abordando as limitações de documentos truncados em modelos de recuperação padrão.