Le projet llama.cpp a publié la compilation b11026, qui introduit une modification pour sauter gate_up_exps lorsque le drapeau TENSOR_SKIP est défini. Cette modification est spécifiquement requise pour les modèles Qwen35MoE où les tenseurs MTP sont fusionnés mais non chargés.
La version fournit des binaires et des frameworks pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) et openEuler.
Cette mise à jour garantit la compatibilité avec des configurations spécifiques de Qwen35MoE en gérant correctement les tenseurs MTP fusionnés mais non chargés.