O projeto llama.cpp lançou a compilação b10796, que inclui uma alteração no carregador de modelos para suportar modelos com diferentes números de especialistas por camada.

  • Adiciona a função `n_expert_used_max` para lidar com verificações de camadas de especialistas durante o carregamento do modelo.
  • Atualiza `llama_model_base::load_hparams` para usar `hparams.n_expert_used_max` em vez de falhar em asserções.
  • Resolve erros ao carregar modelos como NVIDIA Nemotron-3-Puzzle-75B-A9B que têm configurações específicas de especialistas.

Esta atualização permite que o llama.cpp carregue e processe corretamente modelos onde o número de especialistas usados varia entre as camadas, impedindo falhas em asserções durante a inicialização.