AI2 ha lanzado Olmo-core 3, una infraestructura de entrenamiento abierta rediseñada para modelos de mezcla de expertos (MoE) que escala hasta el rango de billones de parámetros mientras mantiene la eficiencia computacional. El marco cambia de paralelismo de datos completamente fragmentado a paralelismo de datos distribuido, manteniendo los expertos residentes en las GPUs para mejorar el rendimiento y reducir los costos de comunicación.

  • Un benchmark en ocho GPUs NVIDIA B300 mostró un MoE de 47 mil millones de parámetros alcanzando 52.000 tokens por segundo por GPU, lo que representa un aumento de 2.7x sobre la implementación anterior.
  • Habilitar la precisión MXFP8 en cuatro GPUs NVIDIA B300 aumentó el rendimiento de entrenamiento aproximadamente un 21% y redujo la memoria activa máxima de 103 GiB a 95 GiB en comparación con BF16.
  • El sistema soporta paralelismo de expertos, de pipeline y del optimizador para distribuir los pesos del modelo y los estados de entrenamiento entre clústeres de GPUs.
  • Los benchmarks demostraron escalabilidad hasta un modelo de 1.2 billones de parámetros con un rendimiento de 858 TFLOP/s/GPU y configuraciones experimentales que alcanzan 2.38 billones de parámetros.

La pila de código abierto sirve como base para la próxima generación de modelos Olmo y permite a los investigadores entrenar sus propios MoE grandes con mayor flexibilidad.