Проект llama.cpp выпустил сборку b10238, которая внедряет поддержку Multi-Token Prediction (MTP) для семейства моделей Qwen3-Next. Это обновление включает специфические изменения в реализации для обработки слоев MTP и исправления, связанные с проверкой типов Python в кодовой базе.
- Добавлена поддержка MTP для моделей Qwen3-Next в src/models/qwen3next.cpp.
- Исправлено вычисление num_mtp непосредственно из слоев MTP и определено opt_num_mtp_layers в _QwenMtpMixin.
- Разрешены проблемы с проверкой типов Python и обновлен gguf-py/gguf/constants.py.
- Предоставлены бинарные файлы для macOS (Apple Silicon/Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) и openEuler.
Это обновление позволяет пользователям запускать модели Qwen3-Next с возможностями MTP на широком спектре аппаратных архитектур и операционных систем.