llama.cpp introduit le support pour le modèle NVIDIA Nemotron-3-Puzzle-75B-A9B, permettant l'inférence pour cette architecture de Mixture of Experts. La mise à jour implémente une infrastructure pour les tailles de feed-forward des experts par couche variables et le routage top-k, qui sont requis car le modèle possède 40 couches MoE avec des valeurs distinctes de n_ff_exp et top-k.
- Ajoute des tableaux n_ff_exp et n_expert_used par couche avec des capacités de chargement d'un scalaire ou d'un tableau.
- Implémente l'infrastructure G1/G2 pour gérer les configurations d'experts hétérogènes entre les couches.
- Met à jour le convertisseur pour analyser block_configs et normaliser les noms de tenseurs pour les checkpoints officiels BF16.
- Distingue Nemotron 3 Puzzle des variantes Super sur la base du tableau expert_used_count par couche.
Ce changement permet à llama.cpp de charger et d'exécuter le modèle Nemotron-3-Puzzle, qui manquait précédemment de support en raison de sa structure MoE complexe et non uniforme.