Proyek llama.cpp merilis build b10238, yang memperkenalkan dukungan Multi-Token Prediction (MTP) untuk keluarga model Qwen3-Next. Pembaruan ini mencakup perubahan implementasi spesifik untuk menangani lapisan MTP dan perbaikan terkait pemeriksaan tipe Python dalam basis kode.

  • Menambahkan dukungan MTP untuk model Qwen3-Next di src/models/qwen3next.cpp.
  • Memperbaiki perhitungan num_mtp langsung dari lapisan MTP dan mendefinisikan opt_num_mtp_layers di _QwenMtpMixin.
  • Menyelesaikan masalah pemeriksaan tipe Python dan memperbarui gguf-py/gguf/constants.py.
  • Menyediakan biner untuk macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), dan openEuler.

Rilis ini memungkinkan pengguna menjalankan model Qwen3-Next dengan kemampuan MTP di berbagai arsitektur perangkat keras dan sistem operasi.