O projeto llama.cpp lançou a versão b10997, que inclui uma alteração na heurística ncols_opt de mosaicos do Mixture of Experts (MoE) para suportar a arquitetura RDNA3.5.
- O código em ggml/src/ggml-cuda/mmq.cu foi atualizado para incluir RDNA3.5 na verificação de condição.
- Testes de desempenho em uma AMD Radeon 8060S mostraram um aumento de velocidade de +16.198% para LFM2.5-8B-A1B-UD-Q4_K_M e +6.189% para Qwen1.5-MoE-A2.7B-Q2_K.
- O lançamento fornece binários para macOS, Linux, Windows, Android e openEuler através dos backends CPU, CUDA, ROCm, Vulkan, OpenVINO e SYCL.