El proyecto llama.cpp lanzó la versión b10707, que incluye una optimización de rendimiento en el manejo del caché de clave-valor (KV). La actualización modifica la función `for_each_token_in` para detener el escaneo una vez que se han visto todas las secuencias dentro de una celda específica, en lugar de iterar por todas las secuencias máximas posibles.

  • Este cambio apunta a la ruta n-gramas a través del llamador `get_prev_tokens`.
  • En una RTX PRO 6000 con Qwen3.8-Flash-Next UD-Q4_K_XL, la velocidad de generación aumentó de 56.3 a 74.3 tokens por segundo en un contexto de 55k.
  • En un contexto de 132k, la velocidad de generación mejoró de 33.6 a 50.9 tokens por segundo.
  • La optimización escala con el número de celdas utilizadas, haciendo que las ganancias sean más visibles en contextos más largos mientras deja sin cambios el procesamiento del prompt.

El lanzamiento proporciona binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.