El proyecto llama.cpp lanzó la versión b10669, que incluye una optimización de rendimiento para la ruta SDPA de oneDNN vinculando la caché KV f16 in situ.

  • El cambio reduce el tráfico de memoria durante los fragmentos de prellenado; por ejemplo, en Qwen3.8 27B con una longitud KV activa de 34816, reduce el tráfico por ubatch de 4.56 GB a menos evitando copias escalonadas.
  • Los binarios están disponibles para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.

Esta actualización proporciona a los usuarios un rendimiento de inferencia optimizado en hardware compatible mientras mantiene una amplia compatibilidad con plataformas.