Проект llama.cpp выпустил версию b10947, которая устраняет критический сбой при загрузке модели Nemotron-H. Обновление защищает от ошибки деления на ноль, возникавшей, когда цикл NextN/MTP для хвостовой части выводил размер экспертного FFN из послойных массивов, содержащих нулевые значения для немодулей MoE.

  • Исправляет сбой SIGFPE, сообщая о некорректной метаданной вместо деления на ноль, если отсутствует expert_feed_forward_length.
  • Предоставляет бинарные файлы для macOS (Apple Silicon и Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) и openEuler.

Это изменение предотвращает падение приложения с ошибкой сигнала при загрузке контрольной точки, обеспечивая стабильную работу для моделей со смешанными слоями MoE и плотными слоями.