El proyecto llama.cpp ha lanzado la versión b10201, que incluye una mejora clave al backend ggml-webgpu. Esta actualización mejora el rendimiento de flash attention al manejar cachés de clave-valor cuantizados durante la generación de contexto largo.

  • Procesamiento vectorial mejorado de flash attention para caché KV cuantizado en ggml-webgpu.
  • Corrección de errores relacionados con la verificación del tipo de valor y actualización de comentarios.
  • Resolución de errores de compilación causados por rebasing.
  • Binarios proporcionados para macOS (Apple Silicon, Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) y openEuler.

Esta versión permite a los usuarios ejecutar llama.cpp en una amplia gama de plataformas de hardware mientras se benefician de mecanismos de atención optimizados para secuencias más largas.