SLAI memperkenalkan T-Rex, sebuah kerangka kerja optimasi end-to-end untuk pelatihan pasca-pelatihan penuh parameter model MoE berskala triliun parameter di Ascend NPU SuperPOD. Menggunakan keluarga model DeepSeek-V4 sebagai beban kerja target, sistem ini mengatasi tekanan memori dan overhead komunikasi melalui paralelisme hierarkis dan optimasi eksekusi kernel.

  • Mencapai 34,22% Model FLOPs Utilization (MFU), mewakili peningkatan 2,93x dibandingkan basis sumber terbuka sambil mempertahankan stabilitas pelatihan.
  • Menetapkan alur kerja Continuous Pre-training (CPT) dan Supervised Fine-Tuning (SFT) untuk tugas Operations Research kompleks menggunakan DeepSeek-V4-Flash.
  • Membuat dataset berisi 10K sampel SFT berkualitas tinggi yang menggabungkan sumber daya domain dengan dokumen optimasi sintetis yang diverifikasi solver di empat kategori tugas.
  • Model khusus mencapai skor zero-shot Pass@1 sebesar 71,81%, mengungguli GPT-5.4-Mini dan DeepSeek-V4-Flash dasar masing-masing sebesar 3,98 dan 11,27 poin persentase.

Karya ini menunjukkan jalur penuh tumpukan dari pelatihan pasca-pelatihan model triliun parameter yang efisien di infrastruktur Ascend hingga model Flash khusus domain untuk pemodelan matematika berbasis solver.