Проект llama.cpp выпустил версию b10247, которая решает проблемы стабильности при загрузке больших моделей Mixture of Experts (MoE) в конфигурациях с несколькими бэкендами. Обновление заменяет массивы фиксированного размера в планировщике бэкенда на динамически выделяемые буферы для обработки разделения графа, превышающего 30 входных тензоров.

  • Заменяет GGML_SCHED_MAX_SPLIT_INPUTS на динамическое выделение памяти для входных данных разделённого графа.
  • Исправляет падения при загрузке широких моделей MoE, таких как Gemma 4, Qwen MoE, Mixtral и DeepSeek.
  • Обновляет расчёт graph_size для использования фактического количества входов вместо фиксированной константы.
  • Предоставляет бинарные файлы для macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android и iOS.

Это изменение позволяет пользователям запускать сложные архитектуры MoE без столкновения с падениями, связанными с планировщиком, на системах с несколькими устройствами бэкенда.