Le projet llama.cpp a publié la version b11214, qui inclut une mise à jour clé du backend HIP. Cette version active le kernel fattn-mma sur les architectures CDNA lorsque dkq est supérieur à 256, visant spécifiquement des améliorations de performance pour les grands lots.

  • Le backend HIP prend désormais en charge le kernel fattn-mma pour dkq > 256 sur le matériel CDNA.
  • Les vérifications CI pour hip-quality-check ont été mises à jour pour ignorer les débordements (spills) pour les kernels mfma mma très grands.
  • Des binaires sont fournis pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.

Cette mise à jour permet aux utilisateurs exécutant llama.cpp sur des GPU AMD CDNA d'utiliser des kernels d'attention optimisés pour des tailles de lots plus grandes.