Проект llama.cpp выпустил сборку b11111, которая внедряет основанные на Vulkan ядра оптимизации flash attention для путей split k в архитектурах Xe-LPG Plus, Xe2 и Xe3.

  • Добавлена оптимизация ядра Intel FA для пути split k в Vulkan.
  • Обновлен хост-код для обработки выбора пути ядра split k FA.
  • Исправлены сбои тестов операторов A770 на Linux путем использования симметричного coopMatMulAdd() в шейдере flash_attn_decode_phase_1.
  • Решены проблемы с editorconfig в файле flash_attn_decode_phase_2.comp.

Это обновление обеспечивает оптимизированные возможности вывода для видеокарт Intel Arc и решает специфические проблемы совместимости драйверов на системах Linux.