SLAI memperkenalkan T-Rex, sebuah kerangka kerja optimasi end-to-end untuk pelatihan pasca-pelatihan parameter penuh model MoE berskala triliun parameter di Ascend NPU SuperPOD. Menggunakan keluarga model DeepSeek-V4 sebagai beban kerja target, sistem ini mengatasi tekanan memori dan overhead komunikasi melalui paralelisme hierarkis dan optimasi eksekusi kernel.
- Infrastruktur mencapai 34,22% Model FLOPs Utilization (MFU), mewakili peningkatan 2,93x dibandingkan basis sumber terbuka sambil menjaga stabilitas pelatihan.
- Alur kerja gabungan CPT dan SFT didirikan untuk tugas-tugas Operations Research yang kompleks, memanfaatkan dokumen optimasi sintetis yang diverifikasi oleh solver.
- Dataset hasil mengandung 10K sampel SFT berkualitas tinggi yang mencakup empat kategori tugas dan tiga representasi masalah.
- Model khusus mencapai skor rata-rata zero-shot Pass@1 sebesar 71,81%, mengungguli GPT-5.4-Mini dan basis DeepSeek-V4-Flash masing-masing sebesar 3,98 dan 11,27 poin persentase.
Karya ini menunjukkan jalur stack penuh untuk pelatihan pasca-pelatihan yang efisien di infrastruktur Ascend, memajukan sistem model frontier untuk penalaran kompleks.