HotpotQAの橋渡し質問に対して凍結された4ビットのQwen2.5-7B-Instructを用いたGPU負荷テストは、タスク対応型のセマンティックルーティングが高妨害条件下で効率性と精度を大幅に向上させることを示している。本研究では、フルキャップドコンテキストと予算の60%を保持するクエリ対応型セマンティックセレクタを比較し、速度と精度において顕著な改善を確認した。

  • Qwenの入力トークンの平均値が41.32%減少し、13,124.5から7,701.8に低下。
  • プリフィル時間の平均が46.85%短縮し、870.8 msから462.8 msに減少。
  • 選択処理を含むエンドツーエンドのレイテンシが45.02%短縮し、943.9 msから518.9 msに低下。
  • ピークVRAM使用量が2.55 GiB削減され、11.71 GiBから9.16 GiBに減少。
  • トークンF1スコアが0.0468増加し、0.5342から0.5810に上昇。

これらの結果は、セマンティックルーティングによってコンテキストの60%のみを保持することで計算コストを削減しつつ、より高い回答品質を生み出すことを示している。ただし、このテストは自然な分布におけるパフォーマンスではなく、長文で無関係なコンテキストに対する堅牢性を特に測定したものである。