llama.cpp 项目发布了版本 b11046,其中引入了对 `flash_attn_f32_f16_bin` 内核的 OpenCL 支持。此更新还包括在 OpenCL 设备上为 Flash Attention 提供的受保护预填充功能。
- 添加了适用于 OpenCL 的 `flash_attn_f32_f16_bin` 内核实现。
- 在 OpenCL 后端实现了 Flash Attention 的受保护预填充逻辑。
- 提供了 macOS (Apple Silicon 和 Intel)、Linux (CPU、CUDA、ROCm、Vulkan、SYCL、OpenVINO)、Windows (CPU、CUDA、Vulkan、SYCL、ROCm、OpenVINO)、Android 和 iOS 的二进制文件。
此版本在保持对主要操作系统和加速器广泛支持的同时,扩展了 OpenCL 设备上的注意力机制的硬件兼容性。