Проект llama.cpp выпустил сборку b11111, которая внедряет основанные на Vulkan ядра оптимизации flash attention для путей split k в архитектурах Xe-LPG Plus, Xe2 и Xe3.
- Добавлена оптимизация ядра Intel FA для пути split k в Vulkan.
- Обновлен хост-код для обработки выбора пути ядра split k FA.
- Исправлены сбои тестов операторов A770 на Linux путем использования симметричного coopMatMulAdd() в шейдере flash_attn_decode_phase_1.
- Решены проблемы с editorconfig в файле flash_attn_decode_phase_2.comp.
Это обновление обеспечивает оптимизированные возможности вывода для видеокарт Intel Arc и решает специфические проблемы совместимости драйверов на системах Linux.