Proyek llama.cpp telah merilis build b10835, yang mencakup perbaikan untuk masalah penghalang divergen dalam implementasi ggml-cuda untuk flash attention f16. Pembaruan ini juga menangani pengaturan pointer metadata duplikat di modul yang sama.
- Memperbaiki penghalang divergen di ggml-cuda flash attention f16 (PR #27870).
- Mencegah pengaturan pointer metadata duplikat di ggml-cuda.
Rilis ini menyediakan biner yang diperbarui untuk macOS, Linux, Windows, Android, dan openEuler di berbagai backend CPU dan GPU termasuk CUDA, Vulkan, ROCm, dan SYCL.