Sentence Transformersライブラリは、後期相互作用検索を利用するマルチベクトル埋め込みモデルの学習とファインチューニングを可能にするコンポーネントであるMultiVectorEncoderを導入しました。この追加により、ユーザーは汎用レトリバーに依存することなく、ゼロから強力なマルチベクトルモデルを構築したり、既存のモデルを特定のドメインに適応させたりすることができます。

  • 実装は、トークンレベルのマッチングがより強力な検索パフォーマンスのために微細な信号を保持するColBERTスタイルのアーキテクチャをサポートしています。
  • ユーザーはmLateOn-unsupervisedなどの既存のチェックポイントをファインチューニングしたり、ModernBERTなどのベーストランスフォーマーを使用して新しいモデルを初期化したりできます。
  • 学習にはデータセット、損失関数、評価器などの特定のコンポーネントが必要であり、Hugging Face Datasets Hub形式に対応しています。
  • 著者は、医療データでのファインチューニングが汎用の密ベクトル、疎ベクトル、および語彙モデルを上回ることを実証しました。

このアプローチにより、標準的な検索モデルにおける文書の切り捨てという制限に対処しつつ、消費者向けハードウェア上でドメイン固有の適応を数時間で可能にします。