Proyek llama.cpp merilis versi b10241, yang mengatasi bug kritis di backend CUDA. Pembaruan ini menyelesaikan data-races yang terjadi saat menggunakan kembali memori bersama (SMEM) selama reduksi blok.
- Memperbaiki ketiadaan resync setelah membaca dari SMEM di block_reduce untuk mencegah data-races.
- Mengimplementasikan double-buffering untuk operasi softmax dan normalisasi baris tunggal.
- Menambahkan komentar penjelasan dan memory barriers secara khusus untuk skenario multi-warp.
- Menyediakan biner untuk macOS, Linux, Windows, Android, dan iOS melalui CPU, CUDA, Vulkan, ROCm, dan backend lainnya.