El proyecto llama.cpp ha lanzado la compilación b10165, que restaura el soporte de cuantización iq4_nl para el backend Flash Attention (FA) de Vulkan. Este cambio aborda el problema #23681 reactivando la función después de que las preocupaciones sobre el uso de memoria compartida se consideraran insignificantes.

  • Añade de nuevo el soporte iq4_nl a la implementación de Vulkan FA.
  • Añade soporte q1_0 para configuraciones non-coopmat2.
  • Corrige el problema de GitHub #23681 respecto a la eliminación del soporte FA q1_0.

El lanzamiento proporciona binarios para macOS, Linux, Windows y Android a través de los backends CPU, CUDA, ROCm, OpenVINO, SYCL y Vulkan.