Оценка на 600 случаях датасета MuSiQue с использованием замороженных моделей Qwen2.5-7B-Instruct и MiniLM проверяет, может ли выбор контекста с учётом мостов превосходить полный контекст и другие базовые методы.

  • Продвижение семантического моста достигло F1 0.3482, превзойдя BM25 (0.3113) и семантическое ядро со случайным продвижением (0.3310).
  • Подход использовал на 16.6% меньше входных токенов, чем полный контекст, при этом сократив время префиллинга на 15.3% и задержку на 9.6%.
  • Парные бутстрап-сравнения показывают статистически значимое улучшение F1 по сравнению с BM25 (+0.0368) и случайными контрольными группами (+0.0172).
  • Разница между продвижением моста и полным контекстом не была однозначной, с дельтой F1 +0.0101.

Результаты указывают на то, что продвижение с учётом мостов надёжнее сохраняет доказательства, несущие зависимости, чем общее сокращение или лексический отбор.