Проект llama.cpp выпустил сборку b10517, внедряя несколько улучшений, специфичных для Vulkan, в путь деквантования flash attention (FA). Ключевые изменения включают деквантование q8_0 KV один раз в coopmat1, пропуск пути FA dequant на coopmat2 и исключение Intel Xe1 из пути FA dequant.
- Vulkan теперь переходит к резервному варианту вместо аварийного завершения, когда scratch для FA превышает maxStorageBufferRange.
- Для выпуска требуется специфическая структура KV-cache в пути FA dequant.
- Ужесточены проверки перестановок для пути FA и исправлено время prealloc_x_need_sync.
- Добавлены тесты для сценариев K/V FA с непрерывно выделенной памятью.
Это обновление повышает стабильность и производительность для пользователей Vulkan, устраняя крайние случаи в управлении памятью и совместимости оборудования.