O SLAI apresenta o T-Rex, um framework de otimização de ponta a ponta para o pós-treinamento de todos os parâmetros de modelos MoE na escala de trilhão de parâmetros no Ascend NPU SuperPOD. Usando a família de modelos DeepSeek-V4 como carga de trabalho alvo, o sistema aborda a pressão de memória e a sobrecarga de comunicação por meio de paralelismo hierárquico e otimizações de execução de kernel.
- Alcança 34,22% de Utilização de FLOPs do Modelo (MFU), representando uma melhoria de 2,93x em relação à linha de base de código aberto enquanto mantém a estabilidade do treinamento.
- Estabelece um fluxo de trabalho de Pré-treinamento Contínuo (CPT) e Ajuste Fino Supervisionado (SFT) para tarefas complexas de Pesquisa Operacional usando o DeepSeek-V4-Flash.
- Cria um conjunto de dados com 10K amostras SFT de alta qualidade, combinando recursos de domínio com documentos de otimização sintéticos verificados por solucionadores em quatro categorias de tarefas.
- O modelo especializado alcança uma pontuação zero-shot Pass@1 de 71,81%, superando o GPT-5.4-Mini e o DeepSeek-V4-Flash base em 3,98 e 11,27 pontos percentuais, respectivamente.
Este trabalho demonstra um caminho completo da pilha desde o pós-treinamento eficiente de modelos de trilhão de parâmetros na infraestrutura Ascend até modelos Flash especializados por domínio para modelagem matemática fundamentada em solucionadores.