SLAI推出了T-Rex,这是一个针对Ascend SuperPOD基础设施上的DeepSeek-V4模型家族的完整参数后训练框架。该系统通过分层优化解决了万亿参数MoE模型的内存压力和通信开销问题。
- 实现了34.22%的Model FLOPs Utilization (MFU),相比开源基线提升了2.93倍。
- 建立了使用求解器验证的合成数据进行运筹学任务的CPT和SFT工作流程。
- 专用的DeepSeek-V4-Flash模型达到了71.81%的零样本Pass@1得分,比GPT-5.4-Mini高出3.98个百分点。
这项工作展示了在Ascend硬件上对前沿模型进行后训练以及为复杂推理创建领域专用能力的有效途径。