El proyecto llama.cpp ha lanzado la versión b11046, que introduce soporte para OpenCL en el kernel `flash_attn_f32_f16_bin`. Esta actualización también incluye funcionalidad de prellenado protegido para Flash Attention en dispositivos OpenCL.

  • Añadida la implementación del kernel `flash_attn_f32_f16_bin` para OpenCL.
  • Implementada la lógica de prellenado protegido para Flash Attention en el backend de OpenCL.
  • Proporcionados binarios para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android e iOS.

Esta versión amplía la compatibilidad de hardware para los mecanismos de atención en dispositivos con capacidad OpenCL, manteniendo un amplio soporte entre los principales sistemas operativos y aceleradores.