Релиз llama.cpp b10728 внедряет реализацию CUDA для XOR swizzle совместно используемой памяти fp16 тайлов Flash Attention K,V. Это обновление также устраняет состояние гонки в разделяемой памяти при Flash Attention на оборудовании DGX Spark.

  • Реализует flash attention с XOR swizzle и fp16 тайлами для CUDA.
  • Исправляет использование 64-битного универсального указателя вместо 32-битного разделяемого указателя.
  • Добавляет тестовые случаи для swizzle и ограничивает синхронизацию только для пути с swizzle.
  • Позволяет swizzling для форм, не являющихся степенью двойки, где nbatch_2%32==0.
  • Рефакторит логику ldmatrix swizzle Flash Attention в вспомогательные функции.

Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, Vulkan, ROCm, OpenVINO и SYCL.