Стресс-тест GPU с замороженной 4-битной моделью Qwen2.5-7B-Instruct на вопросах моста HotpotQA демонстрирует, что осведомлённая о задаче семантическая маршрутизация значительно повышает эффективность и точность в условиях высоких дистракторов. Исследование сравнивало полный ограниченный контекст с запрос-осведомлённым семантическим селектором, сохраняющим 60% бюджета, выявив существенные улучшения скорости и точности.
- Среднее количество входных токенов Qwen снизилось на 41,32%, с 13 124,5 до 7 701,8.
- Среднее время префиллинга уменьшилось на 46,85%, с 870,8 мс до 462,8 мс.
- Сквозная задержка, включая выборку, снизилась на 45,02%, с 943,9 мс до 518,9 мс.
- Пиковое использование VRAM сократилось на 2,55 GiB, с 11,71 GiB до 9,16 GiB.
- Оценка F1 по токенам увеличилась на 0,0468, поднявшись с 0,5342 до 0,5810.
Результаты указывают на то, что сохранение только 60% контекста через семантическую маршрутизацию снижает вычислительные затраты при одновременном повышении качества ответов, хотя тест специально измеряет устойчивость к длинному нерелевантному контексту, а не производительность в естественном распределении.