Проект llama.cpp выпустил сборку b10905, которая включает специфическую настройку Flash Attention для CUDA/HIP на архитектуре gfx1201. Это обновление сосредоточено на оптимизации производительности для GPU AMD RDNA4.

  • HIP: Включает ускоренное матричным умножением (mma) Flash Attention для размера головы 256 на RDNA4 и настраивает связанные конфигурации.
  • HIP: Предпочитает целочисленные тайлы сетки Flash Attention вместо stream-k на архитектурах AMD WMMA.
  • Пересмотрена логика stream_k для улучшения потока выполнения.
  • Пересмотрена логика выбора ядра для лучшего таргетирования оборудования.

Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler через различные бэкенды, включая CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и OpenCL.