SLAI présente T-Rex, un framework d'optimisation de bout en bout pour le post-entraînement à paramètres complets de modèles MoE à l'échelle du trillion de paramètres sur Ascend NPU SuperPOD. En utilisant la famille de modèles DeepSeek-V4 comme charge de travail cible, le système adresse la pression mémoire et les frais de communication grâce au parallélisme hiérarchique et aux optimisations d'exécution de noyaux.
- Atteint une MFU (Model FLOPs Utilization) de 34,22 %, représentant une amélioration de 2,93x par rapport à la référence open-source tout en maintenant la stabilité de l'entraînement.
- Établit un flux de travail de Pré-entraînement Continu (CPT) et d'Ajustement Fin Supervisé (SFT) pour des tâches complexes de Recherche Opérationnelle utilisant DeepSeek-V4-Flash.
- Crée un jeu de données de 10K échantillons SFT de haute qualité combinant des ressources sectorielles avec des documents d'optimisation synthétiques vérifiés par solveur sur quatre catégories de tâches.
- Le modèle spécialisé atteint un score Pass@1 en zero-shot de 71,81 %, surpassant GPT-5.4-Mini et la base DeepSeek-V4-Flash de 3,98 et 11,27 points de pourcentage respectivement.
Ce travail démontre une voie complète de bout en bout allant du post-entraînement efficace de modèles à paramètres complets sur l'infrastructure Ascend aux modèles Flash spécialisés par domaine pour la modélisation mathématique fondée sur des solveurs.