Proyek llama.cpp merilis build b10181, yang mencakup perbaikan di ggml-cuda untuk menonaktifkan Kuantisasi Perkalian Matriks (MMQ) pada GPU dengan memori bersama per blok kurang dari 48 KiB. Sebelumnya, konfigurasi MMQ mengasumsikan batas minimum 48 KiB, menyebabkan kesalahan fatal pada perangkat seperti GPU NVIDIA Pascal dan Moore Threads MTT S70 di mana ukuran ubin melebihi memori yang tersedia.
- Perbaikan ini menambahkan penjaga di `ggml_cuda_should_use_mmq()` untuk memeriksa anggaran memori bersama sebelum memilih ubin MMQ.
- Perangkat dengan memori tidak mencukupi kini beralih ke jalur BLAS selama prefill, menghindari core dump sambil mempertahankan kinerja generasi token.
- Perubahan ini berlaku untuk perangkat CUDA apa pun yang melaporkan memori bersama per blok kurang dari 48 KiB, bukan hanya perangkat MUSA QY1 tertentu.
Pembaruan ini mencegah kerusakan pada perangkat keras lama atau khusus dengan memori bersama terbatas, memastikan inferensi stabil dengan secara otomatis menggunakan backend BLAS yang kompatibel.