O projeto llama.cpp lançou a versão b10707, que inclui uma otimização de desempenho no tratamento do cache de chave-valor (KV). A atualização modifica a função `for_each_token_in` para parar a varredura assim que todas as sequências dentro de uma célula específica forem vistas, em vez de iterar por todas as sequências máximas possíveis.
- Essa mudança tem como alvo o caminho n-gram via o chamador `get_prev_tokens`.
- Em uma RTX PRO 6000 com Qwen3.8-Flash-Next UD-Q4_K_XL, a velocidade de geração aumentou de 56,3 para 74,3 tokens por segundo em um contexto de 55k.
- Em um contexto de 132k, a velocidade de geração melhorou de 33,6 para 50,9 tokens por segundo.
- A otimização escala com o número de células usadas, tornando os ganhos mais visíveis em contextos mais longos, enquanto deixa o processamento do prompt inalterado.
O lançamento fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm) e openEuler.