Una prueba de estrés de GPU utilizando Qwen2.5-7B-Instruct congelado en 4 bits sobre preguntas de puente de HotpotQA demuestra que el enrutamiento semántico consciente de la tarea mejora significativamente la eficiencia y la precisión bajo condiciones de alto distractor. El estudio comparó un contexto completo acotado frente a un selector semántico consciente de la consulta que retiene el 60 % del presupuesto, revelando ganancias sustanciales en velocidad y precisión.
- Los tokens medios de entrada de Qwen cayeron un 41,32 %, pasando de 13.124,5 a 7.701,8.
- El tiempo medio de prefill disminuyó un 46,85 %, pasando de 870,8 ms a 462,8 ms.
- La latencia de extremo a extremo que incluye la selección cayó un 45,02 %, pasando de 943,9 ms a 518,9 ms.
- El uso máximo de VRAM se redujo en 2,55 GiB, pasando de 11,71 GiB a 9,16 GiB.
- La puntuación F1 de tokens aumentó en 0,0468, subiendo de 0,5342 a 0,5810.
Los resultados indican que retener solo el 60 % del contexto mediante enrutamiento semántico reduce los costos computacionales mientras produce una mayor calidad de respuesta, aunque la prueba mide específicamente la robustez frente a un contexto largo e irrelevante en lugar del rendimiento en una distribución natural.