SLAI는 Ascend NPU SuperPOD에서 트릴리언 파라미터 규모의 MoE 모델에 대한 전체 파라미터 사후 학습을 위한 엔드투엔드 최적화 프레임워크인 T-Rex를 소개합니다. DeepSeek-V4 모델 계열을 대상 워크로드로 사용하여, 이 시스템은 계층적 병렬 처리와 커널 실행 최적화를 통해 메모리 압박과 통신 오버헤드를 해결합니다.
- 훈련 안정성을 유지하면서 오픈소스 기준선 대비 2.93배 향상된 34.22%의 모델 FLOPs 활용률(MFU)을 달성합니다.
- DeepSeek-V4-Flash를 사용하여 복잡한 Operations Research 작업을 위한 Continuous Pre-training(CPT) 및 Supervised Fine-Tuning(SFT) 워크플로우를 구축합니다.
- 네 가지 작업 범주에 걸쳐 도메인 자원과 솔버 검증된 합성 최적화 문서를 결합한 10K 개의 고품질 SFT 샘플 데이터셋을 생성합니다.
- 특수화된 모델은 제로샷 Pass@1 점수 71.81%를 달성하여 GPT-5.4-Mini와 기본 DeepSeek-V4-Flash 각각보다 3.98 및 11.27 퍼센트 포인트 더 높은 성능을 보입니다.
이 연구는 Ascend 인프라에서 효율적인 트릴리언 파라미터 모델 사후 학습부터 솔버 기반 수학적 모델링을 위한 도메인 특화 Flash 모델에 이르기까지 풀스택 경로를 보여줍니다.