llama.cpp вводит поддержку модели NVIDIA Nemotron-3-Puzzle-75B-A9B, обеспечивая вывод для этой архитектуры Mixture of Experts. Обновление реализует инфраструктуру для переменных размеров feed-forward экспертов на слой и маршрутизации top-k, что необходимо, поскольку модель имеет 40 слоев MoE с различными значениями n_ff_exp и top-k.

  • Добавляет массивы n_ff_exp и n_expert_used на слой с возможностью загрузки скаляра или массива.
  • Реализует инфраструктуру G1/G2 для обработки гетерогенных конфигураций экспертов между слоями.
  • Обновляет конвертер для разбора block_configs и нормализации имен тензоров для официальных контрольных точек BF16.
  • Различает Nemotron 3 Puzzle и Super варианты на основе массива expert_used_count на слой.

Это изменение позволяет llama.cpp загружать и запускать модель Nemotron-3-Puzzle, которая ранее не поддерживалась из-за ее сложной, неоднородной структуры MoE.