El proyecto llama.cpp ha lanzado la compilación b10835, que incluye una corrección para un problema de barrera divergente dentro de la implementación de ggml-cuda para flash attention f16. Esta actualización también aborda la configuración duplicada del puntero de metadatos en el mismo módulo.

  • Corrige la barrera divergente en ggml-cuda flash attention f16 (PR #27870).
  • Previene la configuración duplicada del puntero de metadatos en ggml-cuda.

Esta versión proporciona binarios actualizados para macOS, Linux, Windows, Android y openEuler a través de varios backends de CPU y GPU que incluyen CUDA, Vulkan, ROCm y SYCL.