O projeto llama.cpp lançou a compilação b10165, que restaura o suporte à quantização iq4_nl para o backend Flash Attention (FA) do Vulkan. Esta alteração aborda a questão #23681 reativando o recurso após as preocupações sobre o uso de memória compartilhada serem consideradas insignificantes.
- Adiciona de volta o suporte iq4_nl à implementação do Vulkan FA.
- Adiciona suporte q1_0 para configurações non-coopmat2.
- Corrige a questão do GitHub #23681 referente à remoção do suporte FA q1_0.
O lançamento fornece binários para macOS, Linux, Windows e Android através dos backends CPU, CUDA, ROCm, OpenVINO, SYCL e Vulkan.