El proyecto llama.cpp lanzó la versión b10247, que aborda problemas de estabilidad al cargar grandes modelos Mixture of Experts (MoE) en configuraciones multi-backend. La actualización reemplaza los arrays de tamaño fijo en el programador del backend con búferes asignados dinámicamente para manejar divisiones de grafos que exceden 30 tensores de entrada.

  • Reemplaza GGML_SCHED_MAX_SPLIT_INPUTS con asignación dinámica para entradas de grafos divididos.
  • Corrige fallos al cargar modelos MoE amplios como Gemma 4, Qwen MoE, Mixtral y DeepSeek.
  • Actualiza el cálculo de graph_size para usar el conteo real de entradas en lugar de una constante fija.
  • Proporciona binarios para macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android e iOS.

Este cambio permite a los usuarios ejecutar arquitecturas MoE complejas sin encontrar fallos relacionados con el programador en sistemas con múltiples dispositivos backend.