O projeto llama.cpp lançou a compilação b11111, que introduz kernels de otimização flash attention baseados em Vulkan para caminhos split k nas arquiteturas Xe-LPG Plus, Xe2 e Xe3.

  • Adicionada otimização do kernel Intel FA para o caminho split k no Vulkan.
  • Código host atualizado para lidar com a seleção do caminho do kernel split k FA.
  • Correção das falhas nos testes de operador A770 no Linux usando coopMatMulAdd() simétrico no shader flash_attn_decode_phase_1.
  • Resolvidos problemas de editorconfig no arquivo flash_attn_decode_phase_2.comp.

Esta atualização fornece capacidades de inferência otimizadas para GPUs Intel Arc e resolve problemas específicos de compatibilidade de drivers em sistemas Linux.