El proyecto llama.cpp ha lanzado la versión b10538, introduciendo una optimización clave en el backend metal. Esta actualización permite la desquantización del caché de claves y valores (KV) exclusivamente para tamaños de lote grandes.

  • El cambio principal está en el backend metal, que ahora aplica el caché KV desquantizado solo al procesar lotes grandes.
  • Los binarios están disponibles para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) y openEuler.

El soporte de KleidiAI en Apple Silicon para macOS y ROCm 7.14 en Ubuntu están deshabilitados en este lanzamiento.

Esta optimización tiene como objetivo mejorar la eficiencia de memoria o el rendimiento para cargas de trabajo que implican tamaños de lote grandes en hardware compatible.