El proyecto llama.cpp lanzó la compilación b11026, que introduce un cambio para omitir gate_up_exps cuando se establece el indicador TENSOR_SKIP. Esta modificación es específicamente necesaria para los modelos Qwen35MoE donde los tensores MTP están fusionados pero no cargados.
El lanzamiento proporciona binarios y marcos de trabajo para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) y openEuler.
Esta actualización garantiza la compatibilidad con configuraciones específicas de Qwen35MoE manejando correctamente los tensores MTP fusionados pero no cargados.