Proyek llama.cpp merilis versi b10997, yang mencakup perubahan pada heuristik ubin ncols_opt Mixture of Experts (MoE) untuk mendukung arsitektur RDNA3.5.
- Kode di ggml/src/ggml-cuda/mmq.cu diperbarui untuk menyertakan RDNA3.5 dalam pemeriksaan kondisi.
- Uji kinerja pada AMD Radeon 8060S menunjukkan percepatan +16.198% untuk LFM2.5-8B-A1B-UD-Q4_K_M dan +6.189% untuk Qwen1.5-MoE-A2.7B-Q2_K.
- Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler melalui backend CPU, CUDA, ROCm, Vulkan, OpenVINO, dan SYCL.