Le projet llama.cpp a publié la version b10247, qui résout des problèmes de stabilité lors du chargement de grands modèles Mixture of Experts (MoE) sur des configurations multi-backend. La mise à jour remplace les tableaux de taille fixe dans le planificateur backend par des tampons alloués dynamiquement pour gérer les divisions de graphe dépassant 30 tenseurs d'entrée.
- Remplace GGML_SCHED_MAX_SPLIT_INPUTS par une allocation dynamique pour les entrées du graphe divisé.
- Corrige les plantages lors du chargement de modèles MoE larges tels que Gemma 4, Qwen MoE, Mixtral et DeepSeek.
- Met à jour le calcul de graph_size pour utiliser le nombre réel d'entrées au lieu d'une constante fixe.
- Fournit des binaires pour macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android et iOS.
Ce changement permet aux utilisateurs d'exécuter des architectures MoE complexes sans rencontrer de plantages liés au planificateur sur les systèmes disposant de plusieurs périphériques backend.