El proyecto llama.cpp ha lanzado la compilación b10603, que introduce el soporte de Predicción Multi-Tokens (MTP) para el modelo GLM-4.5-Air.
- Añade capacidad MTP para GLM-4.5-Air a través del pull request #26534.
- Proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, ROCm) y openEuler.
Esta versión permite a los usuarios ejecutar GLM-4.5-Air con MTP en una amplia gama de arquitecturas de hardware.