O projeto llama.cpp lançou a compilação b11017, que inclui uma otimização do Vulkan para pular trabalho desnecessário de Mixture of Experts (MoE) no caminho mul_mm coopmat1.
Esta atualização fornece binários pré-compilados para macOS (Apple Silicon e Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android e openEuler.
O lançamento também inclui a interface do usuário do llama.cpp.