Un test de stress GPU utilisant Qwen2.5-7B-Instruct gelé en 4 bits sur les questions de pont HotpotQA démontre que le routage sémantique conscient de la tâche améliore significativement l'efficacité et la précision dans des conditions à fort distracteur. L'étude a comparé un contexte complet limité à un sélecteur sémantique conscient de la requête conservant 60 % du budget, révélant des gains substantiels en vitesse et en précision.
- Le nombre moyen de jetons d'entrée Qwen a diminué de 41,32 %, passant de 13 124,5 à 7 701,8.
- Le temps de préremplissage moyen a diminué de 46,85 %, passant de 870,8 ms à 462,8 ms.
- La latence de bout en bout incluant la sélection a diminué de 45,02 %, passant de 943,9 ms à 518,9 ms.
- L'utilisation maximale de VRAM a été réduite de 2,55 GiB, passant de 11,71 GiB à 9,16 GiB.
- Le score F1 des jetons a augmenté de 0,0468, passant de 0,5342 à 0,5810.
Les résultats indiquent que la conservation de seulement 60 % du contexte via le routage sémantique réduit les coûts informatiques tout en produisant une qualité de réponse supérieure, bien que le test mesure spécifiquement la robustesse face à un contexte long et non pertinent plutôt que la performance sur une distribution naturelle.