SLAI 推出 T-Rex,这是一个端到端的优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型系列为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。
- 实现 34.22% 的模型浮点运算利用率(MFU),相比开源基线提升 2.93 倍,同时保持训练稳定性。
- 为使用 DeepSeek-V4-Flash 的复杂运筹学任务建立连续预训练(CPT)和指令微调(SFT)工作流。
- 创建包含 10K 个高质量 SFT 样本的数据集,结合领域资源与求解器验证的合成优化文档,涵盖四个任务类别。
- 专用模型在零样本 Pass@1 指标上达到 71.81%,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高出 3.98 和 11.27 个百分点。
这项工作展示了从 Ascend 基础设施上的高效万亿参数模型后训练到面向求解器的数学建模专用 Flash 模型的全栈路径。