在HotpotQA桥接问题上对冻结的4位Qwen2.5-7B-Instruct进行的GPU压力测试表明,任务感知的语义路由在高干扰条件下显著提高了效率和准确性。该研究对比了完整截断上下文与保留60%预算的查询感知语义选择器,揭示了速度和精度方面的显著提升。

  • Qwen平均输入标记数下降41.32%,从13,124.5降至7,701.8。
  • 平均预填充时间减少46.85%,从870.8毫秒降至462.8毫秒。
  • 包含选择过程的端到端延迟降低45.02%,从943.9毫秒降至518.9毫秒。
  • 峰值显存使用量减少了2.55 GiB,从11.71 GiB降至9.16 GiB。
  • 标记F1分数增加0.0468,从0.5342升至0.5810。

结果表明,通过语义路由仅保留60%的上下文可降低计算成本并产生更高的答案质量,尽管该测试专门衡量对长无关上下文的鲁棒性,而非自然分布下的性能。