Le projet llama.cpp a publié la compilation b10796, qui inclut une modification du chargeur de modèles pour prendre en charge les modèles avec un nombre variable d'experts par couche.

  • Ajoute la fonction `n_expert_used_max` pour gérer les vérifications des couches d'experts lors du chargement du modèle.
  • Met à jour `llama_model_base::load_hparams` pour utiliser `hparams.n_expert_used_max` au lieu de provoquer des échecs d'assertion.
  • Résout les erreurs lors du chargement de modèles comme NVIDIA Nemotron-3-Puzzle-75B-A9B qui ont des configurations d'experts spécifiques.

Cette mise à jour permet à llama.cpp de charger et de traiter correctement les modèles où le nombre d'experts utilisés varie entre les couches, empêchant les échecs d'assertion lors de l'initialisation.