Оценка на 600 случаях датасета MuSiQue с использованием замороженных моделей Qwen2.5-7B-Instruct и MiniLM проверяет, может ли выбор контекста с учётом мостов превосходить полный контекст и другие базовые методы.
- Продвижение семантического моста достигло F1 0.3482, превзойдя BM25 (0.3113) и семантическое ядро со случайным продвижением (0.3310).
- Подход использовал на 16.6% меньше входных токенов, чем полный контекст, при этом сократив время префиллинга на 15.3% и задержку на 9.6%.
- Парные бутстрап-сравнения показывают статистически значимое улучшение F1 по сравнению с BM25 (+0.0368) и случайными контрольными группами (+0.0172).
- Разница между продвижением моста и полным контекстом не была однозначной, с дельтой F1 +0.0101.
Результаты указывают на то, что продвижение с учётом мостов надёжнее сохраняет доказательства, несущие зависимости, чем общее сокращение или лексический отбор.