Проект llama.cpp выпустил сборку b11026, которая вносит изменение, позволяющее пропускать gate_up_exps при установке флага TENSOR_SKIP. Эта модификация специально необходима для моделей Qwen35MoE, где MTP тензоры объединены, но не загружены.
Релиз предоставляет бинарные файлы и фреймворки для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) и openEuler.
Это обновление обеспечивает совместимость с конкретными конфигурациями Qwen35MoE за счет корректной обработки объединенных, но не загруженных MTP тензоров.