SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리 및 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.

  • 인프라는 34.22%의 Model FLOPs Utilization (MFU)를 달성하여, 훈련 안정성을 유지하면서 오픈소스 기준선 대비 2.93배 향상된 성능을 보였습니다.
  • 솔버 검증이 완료된 합성 최적화 문서를 활용하여 복잡한 Operations Research 작업을 위한 결합된 CPT 및 SFT 워크플로우가 구축되었습니다.
  • 결과적으로 생성된 데이터셋은 네 가지 작업 범주와 세 가지 문제 표현을 아우르는 10K개의 고품질 SFT 샘플로 구성됩니다.
  • 이 전문 모델은 평균 제로샷 Pass@1 점수에서 71.81%를 기록하여 GPT-5.4-Mini와 기본 DeepSeek-V4-Flash 각각보다 3.98 및 11.27 퍼센트 포인트 더 높은 성능을 보였습니다.

이 연구는 Ascend 인프라 위에서 효율적인 사후 학습을 위한 풀스택 경로를 보여주며, 복잡한 추론을 위한 프런티어 모델 시스템을 발전시켰습니다.