llama.cpp introduce soporte para el modelo NVIDIA Nemotron-3-Puzzle-75B-A9B, habilitando la inferencia para esta arquitectura de Mezcla de Expertos. La actualización implementa infraestructura para tamaños de alimentación hacia adelante de expertos por capa variables y enrutamiento top-k, que son necesarios porque el modelo tiene 40 capas MoE con valores distintos de n_ff_exp y top-k.

  • Añade matrices n_ff_exp y n_expert_used por capa con capacidades de carga de escalar o matriz.
  • Implementa infraestructura G1/G2 para manejar configuraciones de expertos heterogéneas entre capas.
  • Actualiza el convertidor para analizar block_configs y normalizar nombres de tensores para puntos de control oficiales BF16.
  • Distingue entre Nemotron 3 Puzzle y variantes Super basándose en la matriz expert_used_count por capa.

Este cambio permite a llama.cpp cargar y ejecutar el modelo Nemotron-3-Puzzle, que anteriormente carecía de soporte debido a su estructura MoE compleja y no uniforme.