El proyecto llama.cpp lanzó la compilación b10238, que introduce soporte para Multi-Token Prediction (MTP) en la familia de modelos Qwen3-Next. Esta actualización incluye cambios específicos de implementación para manejar capas MTP y correcciones relacionadas con la verificación de tipos de Python dentro del código base.
- Añadido soporte MTP para modelos Qwen3-Next en src/models/qwen3next.cpp.
- Corregido el cálculo de num_mtp directamente desde las capas MTP y definido opt_num_mtp_layers en _QwenMtpMixin.
- Resueltos los problemas de verificación de tipos de Python y actualizado gguf-py/gguf/constants.py.
- Proporcionados binarios para macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) y openEuler.
Esta versión permite a los usuarios ejecutar modelos Qwen3-Next con capacidades MTP en una amplia gama de arquitecturas de hardware y sistemas operativos.