O projeto llama.cpp lançou a compilação b10251, que introduz suporte de Previsão Multi-Token (MTP) para o modelo GLM-4.7-Flash.
Esta versão inclui binários para macOS (Apple Silicon e Intel), iOS, Linux (Ubuntu x64, arm64, s390x com CPU, Vulkan, ROCm 7.2, OpenVINO e backends SYCL), Android (arm64), Windows (CPU, OpenCL Adreno, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP) e openEuler (ACL Graph).
A compilação KleidiAI do macOS Apple Silicon foi desativada nesta versão.