llama.cpp introduce soporte para el modelo NVIDIA Nemotron-3-Puzzle-75B-A9B, habilitando la inferencia para esta arquitectura de Mezcla de Expertos. La actualización implementa infraestructura para tamaños de alimentación hacia adelante de expertos por capa variables y enrutamiento top-k, que son necesarios porque el modelo tiene 40 capas MoE con valores distintos de n_ff_exp y top-k.
- Añade matrices n_ff_exp y n_expert_used por capa con capacidades de carga de escalar o matriz.
- Implementa infraestructura G1/G2 para manejar configuraciones de expertos heterogéneas entre capas.
- Actualiza el convertidor para analizar block_configs y normalizar nombres de tensores para puntos de control oficiales BF16.
- Distingue entre Nemotron 3 Puzzle y variantes Super basándose en la matriz expert_used_count por capa.
Este cambio permite a llama.cpp cargar y ejecutar el modelo Nemotron-3-Puzzle, que anteriormente carecía de soporte debido a su estructura MoE compleja y no uniforme.