Proyek llama.cpp merilis build b10238, yang memperkenalkan dukungan Multi-Token Prediction (MTP) untuk keluarga model Qwen3-Next. Pembaruan ini mencakup perubahan implementasi spesifik untuk menangani lapisan MTP dan perbaikan terkait pemeriksaan tipe Python dalam basis kode.
- Menambahkan dukungan MTP untuk model Qwen3-Next di src/models/qwen3next.cpp.
- Memperbaiki perhitungan num_mtp langsung dari lapisan MTP dan mendefinisikan opt_num_mtp_layers di _QwenMtpMixin.
- Menyelesaikan masalah pemeriksaan tipe Python dan memperbarui gguf-py/gguf/constants.py.
- Menyediakan biner untuk macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), dan openEuler.
Rilis ini memungkinkan pengguna menjalankan model Qwen3-Next dengan kemampuan MTP di berbagai arsitektur perangkat keras dan sistem operasi.