Le projet llama.cpp a publié la version b10997, qui inclut une modification de l'heuristique de tuile ncols_opt de Mixture of Experts (MoE) pour prendre en charge l'architecture RDNA3.5.
- Le code dans ggml/src/ggml-cuda/mmq.cu a été mis à jour pour inclure RDNA3.5 dans la vérification des conditions.
- Les tests de performance sur une AMD Radeon 8060S ont montré une accélération de +16.198% pour LFM2.5-8B-A1B-UD-Q4_K_M et de +6.189% pour Qwen1.5-MoE-A2.7B-Q2_K.
- La version fournit des binaires pour macOS, Linux, Windows, Android et openEuler via les backends CPU, CUDA, ROCm, Vulkan, OpenVINO et SYCL.