SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el entrenamiento posterior de todos los parámetros de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.
- La infraestructura alcanza un 34,22% de Utilización de FLOPs del Modelo (MFU), lo que representa una mejora de 2,93 veces respecto a la línea base de código abierto mientras mantiene la estabilidad del entrenamiento.
- Se establece un flujo de trabajo combinado de CPT y SFT para tareas complejas de Investigación de Operaciones, utilizando documentos sintéticos de optimización verificados por solucionadores.
- El conjunto de datos resultante contiene 10K muestras de SFT de alta calidad que abarcan cuatro categorías de tareas y tres representaciones de problemas.
- El modelo especializado alcanza una puntuación promedio de cero disparos Pass@1 del 71,81%, superando a GPT-5.4-Mini y al DeepSeek-V4-Flash base en 3,98 y 11,27 puntos porcentuales respectivamente.
Este trabajo demuestra una vía completa para el entrenamiento posterior eficiente en infraestructura Ascend, avanzando los sistemas de modelos de vanguardia para el razonamiento complejo.