O projeto llama.cpp lançou a compilação b11111, que introduz kernels de otimização flash attention baseados em Vulkan para caminhos split k nas arquiteturas Xe-LPG Plus, Xe2 e Xe3.
- Adicionada otimização do kernel Intel FA para o caminho split k no Vulkan.
- Código host atualizado para lidar com a seleção do caminho do kernel split k FA.
- Correção das falhas nos testes de operador A770 no Linux usando coopMatMulAdd() simétrico no shader flash_attn_decode_phase_1.
- Resolvidos problemas de editorconfig no arquivo flash_attn_decode_phase_2.comp.
Esta atualização fornece capacidades de inferência otimizadas para GPUs Intel Arc e resolve problemas específicos de compatibilidade de drivers em sistemas Linux.