O projeto llama.cpp lançou a versão b11046, que introduz suporte para OpenCL no kernel `flash_attn_f32_f16_bin`. Esta atualização também inclui funcionalidade de pré-preenchimento protegido para Flash Attention em dispositivos OpenCL.

  • Adicionada a implementação do kernel `flash_attn_f32_f16_bin` para OpenCL.
  • Implementada a lógica de pré-preenchimento protegido para Flash Attention no backend de OpenCL.
  • Fornecidos binários para macOS (Apple Silicon e Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android e iOS.

Este lançamento expande a compatibilidade de hardware para mecanismos de atenção em dispositivos com capacidade OpenCL, mantendo o amplo suporte entre os principais sistemas operacionais e aceleradores.