llama.cpp プロジェクトは、GLM-4.7-Flash モデルのマルチトークン予測 (MTP) サポートを導入したビルド b10251 をリリースしました。
このリリースには、macOS (Apple Silicon および Intel)、iOS、Linux (Ubuntu x64、arm64、s390x、CPU、Vulkan、ROCm 7.2、OpenVINO、SYCL バックエンド付き)、Android (arm64)、Windows (CPU、OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)、openEuler (ACL Graph) 用のバイナリが含まれています。
このバージョンでは、macOS Apple Silicon の KleidiAI ビルドは無効になっています。