Proyek llama.cpp merilis versi b10241, yang mengatasi bug kritis di backend CUDA. Pembaruan ini menyelesaikan data-races yang terjadi saat menggunakan kembali memori bersama (SMEM) selama reduksi blok.

  • Memperbaiki ketiadaan resync setelah membaca dari SMEM di block_reduce untuk mencegah data-races.
  • Mengimplementasikan double-buffering untuk operasi softmax dan normalisasi baris tunggal.
  • Menambahkan komentar penjelasan dan memory barriers secara khusus untuk skenario multi-warp.
  • Menyediakan biner untuk macOS, Linux, Windows, Android, dan iOS melalui CPU, CUDA, Vulkan, ROCm, dan backend lainnya.