Proyek llama.cpp merilis versi b10327, yang mencakup perbaikan untuk jumlah thread dan blok dalam peluncuran kernel salinan terkuantisasi di CUDA. Pembaruan ini mengatasi masalah yang diidentifikasi dalam pull request #26731.

  • Rilis ini menambahkan tes untuk kasus salinan dengan jumlah blok tidak merata guna memastikan kebenaran.
  • Binari tersedia untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Android, Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP), dan openEuler.
  • XCFramework iOS dan build UI mandiri juga disediakan.

Rilis ini memastikan eksekusi stabil dari operasi salinan terkuantisasi pada perangkat keras CUDA di berbagai platform yang didukung.