Le projet llama.cpp a publié la compilation b10251, qui introduit le support de la Prédiction Multi-Tokens (MTP) pour le modèle GLM-4.7-Flash.
Cette version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (Ubuntu x64, arm64, s390x avec CPU, Vulkan, ROCm 7.2, OpenVINO et backends SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) et openEuler (ACL Graph).
La compilation KleidiAI de macOS Apple Silicon a été désactivée dans cette version.