SLAI presenta T-Rex, un framework de post-entrenamiento con parámetros completos para la familia de modelos DeepSeek-V4 en infraestructura Ascend SuperPOD. El sistema aborda la presión de memoria y la sobrecarga de comunicación en modelos MoE de billones de parámetros mediante optimización jerárquica.

  • Alcanza un 34.22% de Model FLOPs Utilization (MFU), una mejora de 2.93x sobre la línea base de código abierto.
  • Establece un flujo de trabajo CPT y SFT para tareas de Investigación de Operaciones utilizando datos sintéticos verificados por solucionadores.
  • El modelo especializado DeepSeek-V4-Flash alcanza una puntuación zero-shot Pass@1 del 71.81%, superando a GPT-5.4-Mini en 3.98 puntos porcentuales.

Este trabajo demuestra una vía eficiente para el post-entrenamiento de modelos de vanguardia en hardware Ascend y la creación de capacidades especializadas por dominio para razonamiento complejo.