在MuSiQue数据集上使用冻结的Qwen2.5-7B-Instruct和MiniLM模型对600个案例进行评估,测试桥接感知上下文选择是否能优于完整上下文和其他基线。
- 语义桥接提升实现了0.3482的F1分数,超越了BM25(0.3113)和带有随机提升的语义核心(0.3310)。
- 该方法比完整上下文少使用16.6%的输入标记,同时预填充时间减少了15.3%,延迟降低了9.6%。
- 配对自举比较显示,与BM25(+0.0368)和随机控制组相比,F1提升具有统计学显著性。
- 桥接提升与完整上下文之间的差异尚无定论,F1差值为+0.0101。
结果表明,桥接感知提升比通用缩短或词汇选择更可靠地保留了依赖证据。