O projeto llama.cpp lançou a compilação b10238, que introduz o suporte para Multi-Token Prediction (MTP) na família de modelos Qwen3-Next. Esta atualização inclui alterações específicas de implementação para lidar com camadas MTP e correções relacionadas à verificação de tipos do Python no código-fonte.

  • Adicionado suporte para MTP nos modelos Qwen3-Next em src/models/qwen3next.cpp.
  • Corrigido o cálculo de num_mtp diretamente das camadas MTP e definido opt_num_mtp_layers em _QwenMtpMixin.
  • Resolvidos problemas de verificação de tipos do Python e atualizado gguf-py/gguf/constants.py.
  • Fornecidos binários para macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) e openEuler.

Esta versão permite que os usuários executem modelos Qwen3-Next com capacidades MTP em uma ampla gama de arquiteturas de hardware e sistemas operacionais.