O projeto llama.cpp lançou a compilação b11026, que introduz uma alteração para ignorar gate_up_exps quando o sinalizador TENSOR_SKIP está definido. Esta modificação é especificamente necessária para modelos Qwen35MoE onde os tensores MTP estão fundidos, mas não carregados.
O lançamento fornece binários e frameworks para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) e openEuler.
Esta atualização garante a compatibilidade com configurações específicas de Qwen35MoE, tratando corretamente os tensores MTP fundidos, mas não carregados.