El proyecto llama.cpp lanzó la compilación b10796, que incluye un cambio en el cargador de modelos para admitir modelos con diferentes números de expertos por capa.

  • Añade la función `n_expert_used_max` para manejar las comprobaciones de capas de expertos durante la carga del modelo.
  • Actualiza `llama_model_base::load_hparams` para usar `hparams.n_expert_used_max` en lugar de fallar en aserciones.
  • Resuelve errores al cargar modelos como NVIDIA Nemotron-3-Puzzle-75B-A9B que tienen configuraciones de expertos específicas.

Esta actualización permite a llama.cpp cargar y procesar correctamente modelos donde el número de expertos utilizados varía entre capas, evitando fallos en las aserciones durante la inicialización.