SLAI presenta T-Rex, un marco de optimización de extremo a extremo para el postentrenamiento de parámetros completos de modelos MoE a escala de billones de parámetros en Ascend NPU SuperPOD. Utilizando la familia de modelos DeepSeek-V4 como carga de trabajo objetivo, el sistema aborda la presión de memoria y la sobrecarga de comunicación mediante paralelismo jerárquico y optimizaciones de ejecución de kernels.

  • Alcanza una Utilización de FLOPs del Modelo (MFU) del 34,22%, lo que representa una mejora de 2,93 veces respecto a la línea base de código abierto mientras mantiene la estabilidad del entrenamiento.
  • Establece un flujo de trabajo de Preentrenamiento Continuo (CPT) y Ajuste Fino Supervisado (SFT) para tareas complejas de Investigación de Operaciones utilizando DeepSeek-V4-Flash.
  • Crea un conjunto de datos de 10K muestras SFT de alta calidad que combina recursos de dominio con documentos de optimización sintéticos verificados por solucionadores en cuatro categorías de tareas.
  • El modelo especializado alcanza una puntuación zero-shot Pass@1 del 71,81%, superando a GPT-5.4-Mini y al DeepSeek-V4-Flash base en 3,98 y 11,27 puntos porcentuales respectivamente.

Este trabajo demuestra una ruta de pila completa desde el postentrenamiento eficiente de modelos de billones de parámetros en infraestructura Ascend hasta modelos Flash especializados en dominio para modelado matemático basado en solucionadores.