SLAIは、Ascend NPU SuperPOD上で兆規模パラメータのMoEモデルのフルパラメータポストトレーニングのためのエンドツーエンド最適化フレームワークであるT-Rexを導入する。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列処理とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処する。

  • トレーニングの安定性を維持しながら、オープンソースベースラインと比較して2.93倍の改善を示す34.22%のモデルFLOPs利用率(MFU)を達成する。
  • DeepSeek-V4-Flashを使用して、複雑なオペレーションズリサーチタスク用の継続的プリトレーニング(CPT)と教師ありファインチューニング(SFT)ワークフローを確立する。
  • 4つのタスクカテゴリにわたるドメインリソースとソルバー検証済み合成最適化文書を組み合わせた、10K件の高品質なSFTサンプルのデータセットを作成する。
  • 専門モデルはゼロショットPass@1スコア71.81%を達成し、GPT-5.4-MiniおよびベースラインのDeepSeek-V4-Flashそれぞれに対して3.98ポイントおよび11.27ポイント上回る性能を示す。

本取り組みは、Ascendインフラストラクチャ上での効率的な兆規模モデルのポストトレーニングから、ソルバー基盤の数学的モデリングのためのドメイン特化型Flashモデルに至るまでのフルスタックパスウェイを実証する。