O projeto llama.cpp lançou a versão b10635, que inclui atualizações específicas de suporte ao CUDA. A principal alteração é o desbloqueio da multiplicação de matriz de precisão mista (mmq) para arquiteturas Mixture of Experts (MoE) em GPUs com capacidade de computação 6.0 (sm_60).
- CUDA: mmq desbloqueado para MoE em sm_60.
- CUDA: mmq-config-pascal duplicado para dp4a e arquiteturas mais antigas.
- CUDA: Redução da ocupação em GPUs Pascal sem dp4a para formatos de quantização Q2_K, Q4_K, Q5_K e Q6_K.
Esta versão fornece binários para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.