Проект llama.cpp выпустил сборку b10905, которая включает специфическую настройку Flash Attention для CUDA/HIP на архитектуре gfx1201. Это обновление сосредоточено на оптимизации производительности для GPU AMD RDNA4.
- HIP: Включает ускоренное матричным умножением (mma) Flash Attention для размера головы 256 на RDNA4 и настраивает связанные конфигурации.
- HIP: Предпочитает целочисленные тайлы сетки Flash Attention вместо stream-k на архитектурах AMD WMMA.
- Пересмотрена логика stream_k для улучшения потока выполнения.
- Пересмотрена логика выбора ядра для лучшего таргетирования оборудования.
Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler через различные бэкенды, включая CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL и OpenCL.