Проект llama.cpp выпустил сборку b10517, внедряя несколько улучшений, специфичных для Vulkan, в путь деквантования flash attention (FA). Ключевые изменения включают деквантование q8_0 KV один раз в coopmat1, пропуск пути FA dequant на coopmat2 и исключение Intel Xe1 из пути FA dequant.

  • Vulkan теперь переходит к резервному варианту вместо аварийного завершения, когда scratch для FA превышает maxStorageBufferRange.
  • Для выпуска требуется специфическая структура KV-cache в пути FA dequant.
  • Ужесточены проверки перестановок для пути FA и исправлено время prealloc_x_need_sync.
  • Добавлены тесты для сценариев K/V FA с непрерывно выделенной памятью.

Это обновление повышает стабильность и производительность для пользователей Vulkan, устраняя крайние случаи в управлении памятью и совместимости оборудования.