SLAI представляет T-Rex, сквозную оптимизационную рамку для полного параметрического постобучения MoE-моделей триллионного масштаба на Ascend NPU SuperPOD. Используя семейство моделей DeepSeek-V4 в качестве целевой рабочей нагрузки, система решает проблемы с давлением памяти и накладными расходами на коммуникацию за счёт иерархического параллелизма и оптимизаций выполнения ядер.
- Достижение 34.22% Model FLOPs Utilization (MFU), что представляет собой улучшение в 2.93 раза по сравнению с базовой открытой реализацией при сохранении стабильности обучения.
- Создание конвейера Continuous Pre-training (CPT) и Supervised Fine-Tuning (SFT) для сложных задач Operations Research с использованием DeepSeek-V4-Flash.
- Формирование набора данных из 10K высококачественных образцов SFT, объединяющего доменные ресурсы с верифицированными решателем синтетическими документами оптимизации по четырём категориям задач.
- Специализированная модель достигает zero-shot Pass@1 в 71.81%, превосходя GPT-5.4-Mini и базовую DeepSeek-V4-Flash на 3.98 и 11.27 процентных пункта соответственно.
Данная работа демонстрирует полный стек путей от эффективного постобучения триллионнопараметрических моделей на инфраструктуре Ascend до специализированных Flash-моделей для математического моделирования, основанного на решателях.