SLAI 推出 T-Rex,这是一个端到端优化框架,用于在 Ascend NPU SuperPOD 上对万亿参数规模的 MoE 模型进行全参数后训练。以 DeepSeek-V4 模型家族为目标工作负载,该系统通过分层并行和内核执行优化来解决内存压力和通信开销问题。
- 基础设施实现了 34.22% 的模型浮点运算利用率(MFU),相比开源基线提升了 2.93 倍,同时保持了训练稳定性。
- 建立了结合 CPT 和 SFT 的工作流程,用于复杂的运筹学任务,利用求解器验证的合成优化文档。
- 生成的数据集包含 10K 个高质量 SFT 样本,涵盖四个任务类别和三种问题表示形式。
- 专用模型取得了 71.81% 的平均零样本 Pass@1 得分,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高出 3.98 和 11.27 个百分点。
这项工作展示了在 Ascend 基础设施上进行高效后训练的全栈路径,推动了前沿模型系统在复杂推理方面的发展。