Proyek llama.cpp merilis versi b11046, yang memperkenalkan dukungan OpenCL untuk kernel `flash_attn_f32_f16_bin`. Pembaruan ini juga mencakup fungsionalitas prefill terlindungi untuk Flash Attention pada perangkat OpenCL.

  • Menambahkan implementasi kernel `flash_attn_f32_f16_bin` untuk OpenCL.
  • Mengimplementasikan logika prefill terlindungi untuk Flash Attention di backend OpenCL.
  • Menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, CUDA, ROCm, Vulkan, SYCL, OpenVINO), Windows (CPU, CUDA, Vulkan, SYCL, ROCm, OpenVINO), Android, dan iOS.

Rilis ini memperluas kompatibilitas perangkat keras untuk mekanisme perhatian pada perangkat yang mampu OpenCL sambil mempertahankan dukungan luas di seluruh sistem operasi utama dan akselerator.