Le projet llama.cpp a publié la version b10907, qui inclut une correction pour l'allocation du cache clé-valeur de contexte de Multi-Token Prediction (MTP). Cette mise à jour résout les problèmes affectant les architectures deepseek2, glm4moe et cohere2moe.

  • Corrige l'allocation du cache kv de contexte MTP pour les modèles deepseek2, glm4moe et cohere2moe.
  • Ajoute le filtrage par architecture inverse et des tests d'architecture complets pour le filtrage des couches MTP.
  • Simplifie le commentaire du filtre NextN et supprime les modifications de test-llama-archs.

La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.