El proyecto llama.cpp ha lanzado la versión b11214, que incluye una actualización clave al backend HIP. Este lanzamiento habilita el kernel fattn-mma en arquitecturas CDNA cuando dkq es mayor que 256, orientado específicamente a mejoras de rendimiento para grandes tamaños de lote.

  • El backend HIP ahora soporta el kernel fattn-mma para dkq > 256 en hardware CDNA.
  • Las comprobaciones CI para hip-quality-check se han actualizado para ignorar derrames en kernels mfma mma muy grandes.
  • Se proporcionan binarios para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android y openEuler.

Esta actualización permite a los usuarios que ejecutan llama.cpp en GPUs AMD CDNA utilizar kernels de atención optimizados para tamaños de lote más grandes.