SLAIは、Ascend NPU SuperPOD上で兆規模のパラメータを持つMoEモデルのフルパラメータ後処理のためのエンドツーエンド最適化フレームワークであるT-Rexを導入しました。DeepSeek-V4モデルファミリーを対象ワークロードとして使用し、本システムは階層型並列化とカーネル実行の最適化を通じてメモリ圧力と通信オーバーヘッドに対処しています。
- インフラストラクチャは34.22%のModel FLOPs Utilization (MFU)を達成し、トレーニングの安定性を維持しながらオープンソースのベースラインと比較して2.93倍の改善を示しました。
- ソルバー検証済みの合成最適化文書を活用し、複雑なOperations ResearchタスクのためのCPTとSFTの統合ワークフローが確立されました。
- 生成されたデータセットには、4つのタスクカテゴリと3つの問題表現にわたる10K件の高品質なSFTサンプルが含まれています。
- 専門化されたモデルは71.81%の平均ゼロショットPass@1スコアを達成し、GPT-5.4-MiniおよびベースラインのDeepSeek-V4-Flashそれぞれに対して3.98および11.27パーセントポイント上回りました。
本取り組みは、Ascendインフラストラクチャ上で効率的な後処理を行うためのフルスタックパスウェイを示し、複雑な推論のためのフロンティアモデルシステムの発展に寄与しています。