Проект llama.cpp выпустил версию b11046, которая добавляет поддержку OpenCL для ядра `flash_attn_f32_f16_bin`. Это обновление также включает функциональность защищённого префиллинга для Flash Attention на устройствах OpenCL.
- Добавлена реализация ядра `flash_attn_f32_f16_bin` для OpenCL.
- Реализована логика защищённого префиллинга для Flash Attention в бэкенде OpenCL.
- Предоставлены бинарные файлы для macOS (Apple Silicon и Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android и iOS.
Это расширение аппаратной совместимости для механизмов внимания на устройствах с поддержкой OpenCL при сохранении широкой поддержки основных операционных систем и ускорителей.