Le projet llama.cpp a publié la compilation b10165, qui restaure le support de quantification iq4_nl pour le backend Flash Attention (FA) Vulkan. Ce changement résout le problème #23681 en réactivant la fonctionnalité après que les préoccupations concernant l'utilisation de la mémoire partagée aient été jugées négligeables.

  • Ajoute à nouveau le support iq4_nl à l'implémentation Vulkan FA.
  • Ajoute le support q1_0 pour les configurations non-coopmat2.
  • Corrige le problème GitHub #23681 concernant la suppression du support FA q1_0.

La publication fournit des binaires pour macOS, Linux, Windows et Android via les backends CPU, CUDA, ROCm, OpenVINO, SYCL et Vulkan.