El proyecto llama.cpp ha lanzado la compilación b10165, que restaura el soporte de cuantización iq4_nl para el backend Flash Attention (FA) de Vulkan. Este cambio aborda el problema #23681 reactivando la función después de que las preocupaciones sobre el uso de memoria compartida se consideraran insignificantes.
- Añade de nuevo el soporte iq4_nl a la implementación de Vulkan FA.
- Añade soporte q1_0 para configuraciones non-coopmat2.
- Corrige el problema de GitHub #23681 respecto a la eliminación del soporte FA q1_0.
El lanzamiento proporciona binarios para macOS, Linux, Windows y Android a través de los backends CPU, CUDA, ROCm, OpenVINO, SYCL y Vulkan.