SLAIは、Ascend SuperPODインフラストラクチャ上のDeepSeek-V4モデルファミリー向けのフルパラメータポストトレーニングフレームワークであるT-Rexを導入しました。このシステムは、階層化最適化を通じて、兆パラメータのMoEモデルにおけるメモリ圧力と通信オーバーヘッドに対処します。
- 34.22%のModel FLOPs Utilization (MFU)を達成し、オープンソースのベースラインと比較して2.93倍の改善を実現しました。
- ソルバー検証済み合成データを使用して、オペレーションズリサーチタスク用のCPTおよびSFTワークフローを確立しました。
- 専門的なDeepSeek-V4-Flashモデルは、71.81%のゼロショットPass@1スコアを達成し、GPT-5.4-Miniを3.98パーセントポイント上回りました。
この研究は、Ascendハードウェア上でフロンティアモデルのポストトレーニングを行い、複雑な推論のためのドメイン特化型能力を作成するための効率的な経路を示しています。