El proyecto llama.cpp lanzó la versión b10997, que incluye un cambio en la heurística ncols_opt de mosaicos de Mixture of Experts (MoE) para admitir la arquitectura RDNA3.5.
- El código en ggml/src/ggml-cuda/mmq.cu se actualizó para incluir RDNA3.5 en la verificación de condiciones.
- Las pruebas de rendimiento en una AMD Radeon 8060S mostraron una aceleración del +16.198% para LFM2.5-8B-A1B-UD-Q4_K_M y del +6.189% para Qwen1.5-MoE-A2.7B-Q2_K.
- El lanzamiento proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, ROCm, Vulkan, OpenVINO y SYCL.