llama.cpp プロジェクトはビルド b10238 をリリースし、Qwen3-Next モデルファミリーに対して Multi-Token Prediction (MTP) サポートを導入しました。このアップデートには、MTP レイヤーを処理するための特定の実装変更と、コードベース内の Python 型チェックに関連する修正が含まれています。
- src/models/qwen3next.cpp で Qwen3-Next モデルの MTP サポートを追加しました。
- num_mtp の計算を MTP レイヤーから直接行い、_QwenMtpMixin で opt_num_mtp_layers を定義しました。
- Python の型チェックの問題を解決し、gguf-py/gguf/constants.py を更新しました。
- macOS (Apple Silicon/Intel)、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA 12/13、Vulkan、OpenCL、OpenVINO、SYCL、HIP)、openEuler 用のバイナリを提供しました。
このリリースにより、ユーザーは幅広いハードウェアアーキテクチャとオペレーティングシステムで MTP 機能を持つ Qwen3-Next モデルを実行できるようになります。