El proyecto llama.cpp lanzó la compilación b10796, que incluye un cambio en el cargador de modelos para admitir modelos con diferentes números de expertos por capa.
- Añade la función `n_expert_used_max` para manejar las comprobaciones de capas de expertos durante la carga del modelo.
- Actualiza `llama_model_base::load_hparams` para usar `hparams.n_expert_used_max` en lugar de fallar en aserciones.
- Resuelve errores al cargar modelos como NVIDIA Nemotron-3-Puzzle-75B-A9B que tienen configuraciones de expertos específicas.
Esta actualización permite a llama.cpp cargar y procesar correctamente modelos donde el número de expertos utilizados varía entre capas, evitando fallos en las aserciones durante la inicialización.