O projeto llama.cpp lançou a compilação b10603, que introduz o suporte à Predição de Múltiplos Tokens (MTP) para o modelo GLM-4.5-Air.
- Adiciona capacidade MTP para GLM-4.5-Air via pull request #26534.
- Fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, ROCm) e openEuler.
Esta versão permite que os usuários executem o GLM-4.5-Air com MTP em uma ampla gama de arquiteturas de hardware.