Le projet llama.cpp a publié la compilation b10174, introduisant le support du décodage spéculatif NextN/MTP pour l'architecture du modèle GLM_DSA (GLM-5.2).

  • Ajoute GLM-5.2 NextN/MTP comme cible --spec-type draft-mtp, activant l'attention MLA dense et la configuration KV de contexte MTP.
  • Met à jour le script de conversion pour prendre en charge l'exportation --mtp/--no-mtp pour GlmMoeDsaForCausalLM, permettant aux utilisateurs de supprimer ou de conserver le bloc NextN lors de l'exportation.
  • Fournit des binaires précompilés pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) et les plateformes openEuler.

Cette mise à jour permet des vitesses d'inférence plus rapides pour les modèles GLM-5.2 en exploitant les techniques de décodage spéculatif au sein du framework llama.cpp.