O projeto llama.cpp lançou a compilação b10165, que restaura o suporte à quantização iq4_nl para o backend Flash Attention (FA) do Vulkan. Esta alteração aborda a questão #23681 reativando o recurso após as preocupações sobre o uso de memória compartilhada serem consideradas insignificantes.

  • Adiciona de volta o suporte iq4_nl à implementação do Vulkan FA.
  • Adiciona suporte q1_0 para configurações non-coopmat2.
  • Corrige a questão do GitHub #23681 referente à remoção do suporte FA q1_0.

O lançamento fornece binários para macOS, Linux, Windows e Android através dos backends CPU, CUDA, ROCm, OpenVINO, SYCL e Vulkan.