O projeto llama.cpp lançou a compilação b11043, que inclui uma alteração na implementação do flash-attention HMX. Esta atualização habilita o suporte para dimensões de cabeça que não são múltiplos de 64, permitindo especificamente configurações como head_dim=72 do SigLIP.

  • O kernel de flash-attention HMX agora opera com DK/DV arredondados para cima para 64 com lanes finais preenchidos com zeros.
  • Binários pré-compilados estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.

Esta alteração permite que os usuários executem modelos com dimensões de cabeça não padrão em hardware suportado sem problemas de compatibilidade.