O projeto llama.cpp lançou a compilação b10796, que inclui uma alteração no carregador de modelos para suportar modelos com diferentes números de especialistas por camada.
- Adiciona a função `n_expert_used_max` para lidar com verificações de camadas de especialistas durante o carregamento do modelo.
- Atualiza `llama_model_base::load_hparams` para usar `hparams.n_expert_used_max` em vez de falhar em asserções.
- Resolve erros ao carregar modelos como NVIDIA Nemotron-3-Puzzle-75B-A9B que têm configurações específicas de especialistas.
Esta atualização permite que o llama.cpp carregue e processe corretamente modelos onde o número de especialistas usados varia entre as camadas, impedindo falhas em asserções durante a inicialização.