SLAI memperkenalkan T-Rex, sebuah kerangka kerja optimasi end-to-end untuk pelatihan pasca-pelatihan penuh parameter model MoE berskala triliun parameter di Ascend NPU SuperPOD. Menggunakan keluarga model DeepSeek-V4 sebagai beban kerja target, sistem ini mengatasi tekanan memori dan overhead komunikasi melalui paralelisme hierarkis dan optimasi eksekusi kernel.
- Mencapai 34,22% Model FLOPs Utilization (MFU), mewakili peningkatan 2,93x dibandingkan basis sumber terbuka sambil mempertahankan stabilitas pelatihan.
- Menetapkan alur kerja Continuous Pre-training (CPT) dan Supervised Fine-Tuning (SFT) untuk tugas Operations Research kompleks menggunakan DeepSeek-V4-Flash.
- Membuat dataset berisi 10K sampel SFT berkualitas tinggi yang menggabungkan sumber daya domain dengan dokumen optimasi sintetis yang diverifikasi solver di empat kategori tugas.
- Model khusus mencapai skor zero-shot Pass@1 sebesar 71,81%, mengungguli GPT-5.4-Mini dan DeepSeek-V4-Flash dasar masing-masing sebesar 3,98 dan 11,27 poin persentase.
Karya ini menunjukkan jalur penuh tumpukan dari pelatihan pasca-pelatihan model triliun parameter yang efisien di infrastruktur Ascend hingga model Flash khusus domain untuk pemodelan matematika berbasis solver.