Le projet llama.cpp a publié la compilation b10238, qui introduit le support de Multi-Token Prediction (MTP) pour la famille de modèles Qwen3-Next. Cette mise à jour comprend des modifications spécifiques de l'implémentation pour gérer les couches MTP et des correctifs liés à la vérification des types Python dans la base de code.
- Ajout du support MTP pour les modèles Qwen3-Next dans src/models/qwen3next.cpp.
- Correction du calcul de num_mtp directement à partir des couches MTP et définition de opt_num_mtp_layers dans _QwenMtpMixin.
- Résolution des problèmes de vérification des types Python et mise à jour de gguf-py/gguf/constants.py.
- Fourniture de binaires pour macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) et openEuler.
Cette version permet aux utilisateurs d'exécuter des modèles Qwen3-Next avec des capacités MTP sur une large gamme d'architectures matérielles et de systèmes d'exploitation.