llama.cpp 프로젝트는 Qwen3-Next 모델 계열에 대한 Multi-Token Prediction (MTP) 지원을 도입한 빌드 b10238을 출시했습니다. 이 업데이트에는 MTP 레이어를 처리하기 위한 특정 구현 변경 사항과 코드베이스 내 Python 타입 체크와 관련된 수정 사항이 포함되어 있습니다.
- src/models/qwen3next.cpp에서 Qwen3-Next 모델에 대한 MTP 지원을 추가했습니다.
- num_mtp 계산을 MTP 레이어에서 직접 수행하고 _QwenMtpMixin에서 opt_num_mtp_layers를 정의했습니다.
- Python 타입 체크 문제를 해결하고 gguf-py/gguf/constants.py를 업데이트했습니다.
- macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP), openEuler용 바이너리를 제공했습니다.
이 릴리스를 통해 사용자는 광범위한 하드웨어 아키텍처와 운영 체제에서 MTP 기능을 갖춘 Qwen3-Next 모델을 실행할 수 있습니다.