SLAI présente T-Rex, un framework d'optimisation de bout en bout pour le post-entraînement à paramètres complets de modèles MoE à l'échelle du trillion de paramètres sur Ascend NPU SuperPOD. En utilisant la famille de modèles DeepSeek-V4 comme charge de travail cible, le système adresse la pression mémoire et les frais de communication grâce à un parallélisme hiérarchique et des optimisations d'exécution de noyaux.

  • L'infrastructure atteint une Utilisation des FLOPs du Modèle (MFU) de 34,22 %, représentant une amélioration de 2,93x par rapport à la référence open-source tout en maintenant la stabilité de l'entraînement.
  • Un workflow combinant CPT et SFT est établi pour des tâches complexes d'Optimisation Opérationnelle, utilisant des documents d'optimisation synthétiques vérifiés par des solveurs.
  • L'ensemble de données résultant contient 10K échantillons SFT de haute qualité couvrant quatre catégories de tâches et trois représentations de problèmes.
  • Le modèle spécialisé atteint un score moyen zero-shot Pass@1 de 71,81 %, surpassant GPT-5.4-Mini et la base DeepSeek-V4-Flash de 3,98 et 11,27 points de pourcentage respectivement.

Ce travail démontre une voie complète pour un post-entraînement efficace sur l'infrastructure Ascend, faisant progresser les systèmes de modèles de pointe pour le raisonnement complexe.