El proyecto llama.cpp ha lanzado la versión b11046, que introduce soporte para OpenCL en el kernel `flash_attn_f32_f16_bin`. Esta actualización también incluye funcionalidad de prellenado protegido para Flash Attention en dispositivos OpenCL.
- Añadida la implementación del kernel `flash_attn_f32_f16_bin` para OpenCL.
- Implementada la lógica de prellenado protegido para Flash Attention en el backend de OpenCL.
- Proporcionados binarios para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android e iOS.
Esta versión amplía la compatibilidad de hardware para los mecanismos de atención en dispositivos con capacidad OpenCL, manteniendo un amplio soporte entre los principales sistemas operativos y aceleradores.