El proyecto llama.cpp lanzó la compilación b11111, que introduce kernels de optimización flash attention basados en Vulkan para rutas split k en las arquitecturas Xe-LPG Plus, Xe2 y Xe3.

  • Añadida la optimización del kernel Intel FA para la ruta split k en Vulkan.
  • Actualizado el código host para manejar la selección de la ruta del kernel split k FA.
  • Corregidos los fallos de prueba de operadores de A770 en Linux mediante el uso de coopMatMulAdd() simétrico en el shader flash_attn_decode_phase_1.
  • Resueltos los problemas de editorconfig en el archivo flash_attn_decode_phase_2.comp.

Esta actualización proporciona capacidades de inferencia optimizadas para GPUs Intel Arc y resuelve problemas específicos de compatibilidad de controladores en sistemas Linux.