Proyek llama.cpp merilis build b10813, yang memperkenalkan implementasi OpenCL untuk GPU Adreno menggunakan jalur xmem SDPA (Scaled Dot-Product Attention). Pembaruan ini juga mengatasi kesalahan numerik dalam mekanisme GQA dan perhatian termaskir.
- Menambahkan jalur Adreno xmem SDPA untuk akselerasi OpenCL.
- Menghapus penimpaan pemprofilan antrian spesifik Adreno.
- Memperbaiki kesalahan numerik pada GQA dan perhatian termaskir.
- Memperkenalkan variabel lingkungan GGML_OPENCL_XMEM_SDPA untuk mengontrol fitur tersebut.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, GPU, dan perangkat keras khusus.