El proyecto llama.cpp lanzó la compilación b10517, introduciendo varias mejoras específicas de Vulkan en la ruta de desquantización de flash attention (FA). Los cambios clave incluyen desquantizar q8_0 KV una vez en coopmat1, omitir la ruta de desquantización FA en coopmat2 y excluir Intel Xe1 de la ruta de desquantización FA.

  • Vulkan ahora hace fallback en lugar de abortar cuando el scratch de FA excede maxStorageBufferRange.
  • La versión requiere un diseño específico de KV-cache en la ruta de desquantización FA.
  • Se ajustaron las comprobaciones de permutación para la ruta FA y se corrigió el tiempo de prealloc_x_need_sync.
  • Se añadieron pruebas para escenarios K/V FA con asignación contigua.

Esta actualización mejora la estabilidad y el rendimiento para usuarios de Vulkan al abordar casos límite en la gestión de memoria y compatibilidad de hardware.