O projeto llama.cpp lançou a compilação b11064, que modifica o backend metal para suportar contagens de cabeças (hc) arbitrárias no kernel dsv4_hc_pre. Anteriormente, esses kernels tinham hc = 4 codificado, fazendo com que operações com outras contagens de cabeças recuassem para execução na CPU.
- A mudança passa n_hc como uma constante de função e faz um loop sobre ela em ambos os kernels anteriores com carregamentos diretos.
- Casos de teste-backend-ops foram adicionados para valores de hc de 1, 2, 3, 5, 8 e 65, cobrindo cenários com e sem gating.
- Esta atualização permite que modelos como o Kimi-K3 sejam executados eficientemente na GPU ao suportar contagens de checkpoints em bancos dinâmicos na pilha residual entre camadas cruzadas.
O lançamento inclui binários para macOS, Linux, Windows, Android e openEuler através de vários backends de hardware, incluindo CPU, CUDA, ROCm, Vulkan, OpenVINO e SYCL.