Проект llama.cpp выпустил версию b10997, которая включает изменение в эвристике ncols_opt тайла Mixture of Experts (MoE) для поддержки архитектуры RDNA3.5.
- Код в ggml/src/ggml-cuda/mmq.cu был обновлен, чтобы включить RDNA3.5 в проверку условия.
- Тесты производительности на AMD Radeon 8060S показали ускорение на +16.198% для LFM2.5-8B-A1B-UD-Q4_K_M и +6.189% для Qwen1.5-MoE-A2.7B-Q2_K.
- Релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для бэкендов CPU, CUDA, ROCm, Vulkan, OpenVINO и SYCL.