HotpotQA 브리지 질문에 대해 동결된 4비트 Qwen2.5-7B-Instruct를 사용한 GPU 스트레스 테스트는 작업 인식 시맨틱 라우팅이 높은 방해 조건 하에서 효율성과 정확성을 크게 향상시킨다는 것을 보여줍니다. 이 연구는 전체 제한 컨텍스트와 예산의 60%를 유지하는 쿼리 인식 시맨틱 선택자를 비교했으며, 속도와 정밀도에서 상당한 개선을 발견했습니다.

  • 평균 Qwen 입력 토큰이 41.32% 감소하여 13,124.5에서 7,701.8로 줄었습니다.
  • 평균 프리필 시간(pre-fill time)이 46.85% 감소하여 870.8 ms에서 462.8 ms로 단축되었습니다.
  • 선택 시간을 포함한 엔드 투 엔드 지연 시간이 45.02% 감소하여 943.9 ms에서 518.9 ms로 줄었습니다.
  • 최대 VRAM 사용량이 2.55 GiB 감소하여 11.71 GiB에서 9.16 GiB로 낮아졌습니다.
  • 토큰 F1 점수가 0.0468 증가하여 0.5342에서 0.5810으로 상승했습니다.

이 결과는 시맨틱 라우팅을 통해 컨텍스트의 60%만 유지하면 계산 비용을 줄이면서 더 높은 답변 품질을 생성할 수 있음을 나타내지만, 해당 테스트는 자연 분포 성능보다는 긴 관련성 없는 컨텍스트에 대한 견고성을 구체적으로 측정합니다.