Um teste de estresse de GPU usando o modelo congelado Qwen2.5-7B-Instruct em 4 bits nas perguntas de ponte do HotpotQA demonstra que o roteamento semântico consciente da tarefa melhora significativamente a eficiência e a precisão sob condições com alto número de distratores. O estudo comparou o contexto completo limitado contra um seletor semântico consciente da consulta, que retém 60% do orçamento, revelando ganhos substanciais em velocidade e precisão.
- A média de tokens de entrada do Qwen caiu 41,32%, de 13.124,5 para 7.701,8.
- O tempo médio de pré-filling diminuiu 46,85%, de 870,8 ms para 462,8 ms.
- A latência de ponta a ponta, incluindo a seleção, caiu 45,02%, de 943,9 ms para 518,9 ms.
- O uso de pico de VRAM foi reduzido em 2,55 GiB, de 11,71 GiB para 9,16 GiB.
- A pontuação F1 de tokens aumentou em 0,0468, subindo de 0,5342 para 0,5810.
Os resultados indicam que reter apenas 60% do contexto por meio de roteamento semântico reduz os custos computacionais enquanto produz maior qualidade nas respostas, embora o teste meça especificamente a robustez a contextos longos e irrelevantes, em vez do desempenho na distribuição natural.