O projeto llama.cpp lançou a versão b10247, que aborda problemas de estabilidade ao carregar grandes modelos Mixture of Experts (MoE) em configurações multi-backend. A atualização substitui arrays de tamanho fixo no agendador do backend por buffers alocados dinamicamente para lidar com divisões de gráfico que excedem 30 tensores de entrada.
- Substitui GGML_SCHED_MAX_SPLIT_INPUTS por alocação dinâmica para entradas de gráficos divididos.
- Corrige travamentos ao carregar modelos MoE largos como Gemma 4, Qwen MoE, Mixtral e DeepSeek.
- Atualiza o cálculo do graph_size para usar a contagem real de entradas em vez de uma constante fixa.
- Fornece binários para macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android e iOS.
Esta alteração permite que os usuários executem arquiteturas MoE complexas sem encontrar travamentos relacionados ao agendador em sistemas com múltiplos dispositivos de backend.