llama.cpp introduz suporte para o modelo NVIDIA Nemotron-3-Puzzle-75B-A9B, habilitando inferência para esta arquitetura de Mixture of Experts. A atualização implementa infraestrutura para tamanhos de feed-forward de experts por camada variáveis e roteamento top-k, que são necessários porque o modelo tem 40 camadas MoE com valores distintos de n_ff_exp e top-k.

  • Adiciona arrays n_ff_exp e n_expert_used por camada com capacidades de carregamento de escalar ou array.
  • Implementa infraestrutura G1/G2 para lidar com configurações de experts heterogêneas entre camadas.
  • Atualiza o conversor para analisar block_configs e normalizar nomes de tensores para checkpoints oficiais BF16.
  • Distingue Nemotron 3 Puzzle de variantes Super com base no array expert_used_count por camada.

Esta alteração permite que o llama.cpp carregue e execute o modelo Nemotron-3-Puzzle, que anteriormente carecia de suporte devido à sua estrutura MoE complexa e não uniforme.