O projeto llama.cpp lançou a compilação b10730, que inclui otimizações para a arquitetura do modelo Qwen4exp. A principal alteração envolve somar as cabeças do indexador por fatias em vez de usar uma operação de transposição e sum_rows, reduzindo a sobrecarga de cópia de memória.
- A velocidade de processamento de prompts aumentou de 2170 para 2366 tokens por segundo em uma RTX PRO 6000 com Qwen3.8-Flash-Next UD-Q4_K_XL.
- A otimização remove a exigência redundante de tensores contíguos para a consulta do indexador, já que o rope retorna um tensor contíguo recém-alocado.
- A velocidade de geração permanece inalterada, mas o ganho no processamento de prompts escala com o comprimento do contexto e o tamanho do ubatch.
- A saída gulosa (greedy) é inalterada token a token em comparação com versões anteriores.
Esta atualização melhora a eficiência para tarefas de inferência de longo contexto envolvendo modelos Qwen4exp, reduzindo o desperdício computacional durante a fase de processamento de prompts.