llama.cpp प्रोजेक्ट ने b10238 बिल्ड जारी किया, जिसमें Qwen3-Next मॉडल परिवार के लिए Multi-Token Prediction (MTP) समर्थन पेश किया गया है। इस अपडेट में MTP परतों को हैंडल करने के लिए विशिष्ट कार्यान्वयन बदलाव और कोडबेस के भीतर पायथन टाइप चेकिंग से संबंधित सुधार शामिल हैं।

  • src/models/qwen3next.cpp में Qwen3-Next मॉडल्स के लिए MTP समर्थन जोड़ा गया।
  • num_mtp की गणना सीधे MTP परतों से की गई और _QwenMtpMixin में opt_num_mtp_layers को परिभाषित किया गया।
  • पायथन टाइप-चेकिंग समस्याओं को हल किया गया और gguf-py/gguf/constants.py को अपडेट किया गया।
  • macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), और openEuler के लिए बाइनरी प्रदान की गईं।

इस रिलीज से उपयोगकर्ताओं को हार्डवेयर आर्किटेक्चर और ऑपरेटिंग सिस्टम के व्यापक श्रृंखला पर MTP क्षमताओं के साथ Qwen3-Next मॉडल चलाने की सुविधा मिलती है।