O projeto llama.cpp lançou a compilação b10238, que introduz o suporte para Multi-Token Prediction (MTP) na família de modelos Qwen3-Next. Esta atualização inclui alterações específicas de implementação para lidar com camadas MTP e correções relacionadas à verificação de tipos do Python no código-fonte.
- Adicionado suporte para MTP nos modelos Qwen3-Next em src/models/qwen3next.cpp.
- Corrigido o cálculo de num_mtp diretamente das camadas MTP e definido opt_num_mtp_layers em _QwenMtpMixin.
- Resolvidos problemas de verificação de tipos do Python e atualizado gguf-py/gguf/constants.py.
- Fornecidos binários para macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) e openEuler.
Esta versão permite que os usuários executem modelos Qwen3-Next com capacidades MTP em uma ampla gama de arquiteturas de hardware e sistemas operacionais.