O projeto llama.cpp lançou a versão b10247, que aborda problemas de estabilidade ao carregar grandes modelos Mixture of Experts (MoE) em configurações multi-backend. A atualização substitui arrays de tamanho fixo no agendador do backend por buffers alocados dinamicamente para lidar com divisões de gráfico que excedem 30 tensores de entrada.

  • Substitui GGML_SCHED_MAX_SPLIT_INPUTS por alocação dinâmica para entradas de gráficos divididos.
  • Corrige travamentos ao carregar modelos MoE largos como Gemma 4, Qwen MoE, Mixtral e DeepSeek.
  • Atualiza o cálculo do graph_size para usar a contagem real de entradas em vez de uma constante fixa.
  • Fornece binários para macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android e iOS.

Esta alteração permite que os usuários executem arquiteturas MoE complexas sem encontrar travamentos relacionados ao agendador em sistemas com múltiplos dispositivos de backend.