La versión b11413 de llama.cpp introduce una nueva implementación de atención flash dispersa en Vulkan que soporta tensores de Clave y Valor cuantizados. Esta actualización aborda problemas de rendimiento en el método anterior de compactación, que era demasiado costoso para tareas de decodificación con ventanas de contexto grandes.

  • El nuevo enfoque divide las filas en segmentos contiguos procesados por subgrupos o hilos, utilizando conteo de votos sobre cargas coalescidas para mantener una lista de índices ascendente.
  • Los binarios precompilados están disponibles para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, Vulkan, CUDA, OpenVINO, SYCL, ROCm), Android e iOS.
  • La versión también incluye la interfaz de usuario de llama.cpp y atestiguaciones para verificación de seguridad.