El proyecto llama.cpp lanzó la compilación b11111, que introduce kernels de optimización flash attention basados en Vulkan para rutas split k en las arquitecturas Xe-LPG Plus, Xe2 y Xe3.
- Añadida la optimización del kernel Intel FA para la ruta split k en Vulkan.
- Actualizado el código host para manejar la selección de la ruta del kernel split k FA.
- Corregidos los fallos de prueba de operadores de A770 en Linux mediante el uso de coopMatMulAdd() simétrico en el shader flash_attn_decode_phase_1.
- Resueltos los problemas de editorconfig en el archivo flash_attn_decode_phase_2.comp.
Esta actualización proporciona capacidades de inferencia optimizadas para GPUs Intel Arc y resuelve problemas específicos de compatibilidad de controladores en sistemas Linux.