O projeto llama.cpp lançou a versão b11214, que inclui uma atualização chave para o backend HIP. Este lançamento habilita o kernel fattn-mma nas arquiteturas CDNA quando dkq é maior que 256, focado especificamente em melhorias de desempenho para grandes tamanhos de lote.

  • O backend HIP agora suporta o kernel fattn-mma para dkq > 256 em hardware CDNA.
  • As verificações CI para hip-quality-check foram atualizadas para ignorar derramamentos em kernels mfma mma muito grandes.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.

Esta atualização permite que usuários executando llama.cpp em GPUs AMD CDNA utilizem kernels de atenção otimizados para tamanhos de lote maiores.