llama.cpp 프로젝트가 버전 b11046을 출시하여 `flash_attn_f32_f16_bin` 커널에 대한 OpenCL 지원을 도입했습니다. 이 업데이트에는 OpenCL 장치에서 Flash Attention을 위한 보호된 prefill 기능도 포함되어 있습니다.
- OpenCL용 `flash_attn_f32_f16_bin` 커널 구현 추가.
- OpenCL 백엔드에서 Flash Attention을 위한 보호된 prefill 로직 구현.
- macOS (Apple Silicon 및 Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android 및 iOS용 바이너리 제공.
이 릴리스는 주요 운영 체제와 가속기 전반에 걸친 광범위한 지원을 유지하면서 OpenCL 지원 장치에서 어텐션 메커니즘의 하드웨어 호환성을 확장합니다.