Le projet llama.cpp a publié la compilation b11017, qui inclut une optimisation Vulkan pour sauter le travail inutile de Mixture of Experts (MoE) dans le chemin mul_mm coopmat1.

Cette mise à jour fournit des binaires précompilés pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android et openEuler.

La version inclut également l'interface utilisateur de llama.cpp.