O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhões de parâmetros no Ascend NPU SuperPOD. Utilizando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernels.
- A infraestrutura alcança 34,22% de Utilização de FLOPs do Modelo (MFU), representando uma melhoria de 2,93x em relação à linha de base de código aberto, mantendo a estabilidade do treinamento.
- Um fluxo de trabalho combinado de CPT e SFT é estabelecido para tarefas complexas de Pesquisa Operacional, utilizando documentos de otimização sintéticos verificados por solucionadores.
- O conjunto de dados resultante contém 10K amostras de SFT de alta qualidade abrangendo quatro categorias de tarefas e três representações de problemas.
- O modelo especializado alcança uma pontuação média zero-shot Pass@1 de 71,81%, superando o GPT-5.4-Mini e o DeepSeek-V4-Flash base em 3,98 e 11,27 pontos percentuais, respectivamente.
Este trabalho demonstra um caminho de pilha completa para o pós-treinamento eficiente na infraestrutura Ascend, avançando os sistemas de modelos de fronteira para raciocínio complexo.