O projeto llama.cpp lançou a versão b11046, que introduz suporte para OpenCL no kernel `flash_attn_f32_f16_bin`. Esta atualização também inclui funcionalidade de pré-preenchimento protegido para Flash Attention em dispositivos OpenCL.
- Adicionada a implementação do kernel `flash_attn_f32_f16_bin` para OpenCL.
- Implementada a lógica de pré-preenchimento protegido para Flash Attention no backend de OpenCL.
- Fornecidos binários para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android e iOS.
Este lançamento expande a compatibilidade de hardware para mecanismos de atenção em dispositivos com capacidade OpenCL, mantendo o amplo suporte entre os principais sistemas operacionais e aceleradores.