Proyek llama.cpp merilis versi b10635, yang mencakup pembaruan spesifik untuk dukungan CUDA. Perubahan utamanya adalah pembukaan kembali perkalian matrik presisi campuran (mmq) untuk arsitektur Mixture of Experts (MoE) pada GPU dengan kemampuan komputasi 6.0 (sm_60).

  • CUDA: mmq dibuka untuk MoE di sm_60.
  • CUDA: mmq-config-pascal diduplikasi untuk dp4a dan arsitektur yang lebih lama.
  • CUDA: Pengurangan okupansi pada GPU Pascal non-dp4a untuk format kuantisasi Q2_K, Q4_K, Q5_K, dan Q6_K.

Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, dan openEuler.