Proyek llama.cpp merilis build b11282, yang mencakup perbaikan untuk mendefinisikan makro `CUDA_ARCH` untuk terusan perangkat MUSA. Sebelumnya, header vendor MUSA gagal mendefinisikan variabel ini, menyebabkan tes arsitektur dalam sumber ggml-cuda bersama dievaluasi ke nol dan menghasilkan tubuh kernel kosong.
- Perbaikan melaporkan arsitektur terbaru mirip dengan backend HIP sambil secara eksplisit mengecualikan fitur NVIDIA-only yang tidak kompatibel dengan MUSA.
- `CUDA_ARCH` sekarang hanya didefinisikan untuk terusan perangkat agar selaras dengan logika deteksi CUB dan perilaku nvcc.
- Pemeriksaan redundan `defined(CUDA_ARCH)` dalam perbandingan arsitektur dihapus karena makro tidak terdefinisi dalam terusan host untuk CUDA dan MUSA.
Perubahan ini memastikan bahwa tubuh kernel yang digating oleh arsitektur, seperti kernel dequantisasi q8_0 -> f16, dikompilasi dengan benar untuk perangkat MUSA alih-alih mengembang menjadi tubuh kosong.