凍結されたQwen2.5-7B-InstructおよびMiniLMモデルを用いたMuSiQueデータセットの600ケース評価により、ブリッジ対応コンテキスト選択が完全コンテキストや他のベースラインを上回るかどうかを検証した。

  • セマンティックブリッジプロモーションはF1スコア0.3482を達成し、BM25(0.3113)およびランダムプロモーション付きセマンティックコア(0.3310)を上回った。
  • この手法は、完全コンテキストと比較して入力トークンを16.6%削減しつつ、プリフィル時間を15.3%、レイテンシを9.6%短縮した。
  • ペアードブートストラップ比較により、BM25(+0.0368)およびランダムコントロール(+0.0172)に対して統計的に有意なF1の向上が示された。
  • ブリッジプロモーションと完全コンテキストの差は結論づけられず、F1デルタは+0.0101であった。

これらの結果は、ブリッジ対応プロモーションが、一般的な短縮や語彙選択よりも依存関係を持つ証拠をより確実に保持することを示唆している。