SLAI présente T-Rex, un framework de post-entraînement à paramètres complets pour la famille de modèles DeepSeek-V4 sur l'infrastructure Ascend SuperPOD. Le système adresse la pression mémoire et la surcharge de communication dans les modèles MoE de billions de paramètres grâce à une optimisation hiérarchique.

  • Atteint 34,22 % de Model FLOPs Utilization (MFU), soit une amélioration de 2,93x par rapport à la ligne de base open-source.
  • Établit un flux de travail CPT et SFT pour les tâches de recherche opérationnelle en utilisant des données synthétiques vérifiées par des solveurs.
  • Le modèle spécialisé DeepSeek-V4-Flash atteint un score zero-shot Pass@1 de 71,81 %, surpassant GPT-5.4-Mini de 3,98 points de pourcentage.

Ce travail démontre une voie efficace pour le post-entraînement des modèles de pointe sur le matériel Ascend et la création de capacités spécialisées par domaine pour le raisonnement complexe.