Sentence Transformers 라이브러리는 늦은 상호작용 검색을 활용하는 다중 벡터 임베딩 모델의 학습 및 파인튜닝을 가능하게 하는 구성 요소인 MultiVectorEncoder를 도입했습니다. 이 추가 기능으로 사용자는 범용 검색기에 의존하지 않고 처음부터 강력한 다중 벡터 모델을 구축하거나 기존 모델을 특정 도메인에 맞게 조정할 수 있습니다.

  • 이 구현은 토큰 수준의 매칭이 더 강력한 검색 성능을 위해 세밀한 신호를 보존하는 ColBERT 스타일 아키텍처를 지원합니다.
  • 사용자는 mLateOn-unsupervised와 같은 기존 체크포인트를 파인튜닝하거나 ModernBERT와 같은 기본 트랜스포머를 사용하여 새로운 모델을 초기화할 수 있습니다.
  • 학습에는 데이터셋, 손실 함수, 평가기 등 특정 구성 요소가 필요하며 Hugging Face Datasets Hub 형식을 지원합니다.
  • 저자는 의료 데이터에 대한 파인튜닝이 범용 밀집, 희소 및 어휘 모델보다 더 우수한 성능을 보인다고 입증했습니다.

이 접근 방식은 소비자 하드웨어에서 몇 시간 만에 도메인 특화 적응을 가능하게 하여 표준 검색 모델의 잘린 문서 한계를 해결합니다.