Le projet llama.cpp a publié la compilation b10603, qui introduit le support de la Prédiction Multi-Tokens (MTP) pour le modèle GLM-4.5-Air.
- Ajoute la capacité MTP pour GLM-4.5-Air via la pull request #26534.
- Fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, ROCm) et openEuler.
Cette version permet aux utilisateurs d'exécuter GLM-4.5-Air avec MTP sur une large gamme d'architectures matérielles.