El proyecto llama.cpp ha lanzado la compilación b10251, que introduce soporte de Predicción Multi-Tokens (MTP) para el modelo GLM-4.7-Flash.
Esta versión incluye binarios para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x con CPU, Vulkan, ROCm 7.2, OpenVINO y backends SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) y openEuler (ACL Graph).
La compilación KleidiAI de macOS Apple Silicon ha sido deshabilitada en esta versión.