A AI2 lançou o Olmo-core 3, uma infraestrutura de treinamento aberta redesenhada para modelos mixture-of-experts (MoE) que escala até a faixa de trilhões de parâmetros enquanto mantém a eficiência computacional. O framework muda de paralelismo de dados totalmente fragmentado para paralelismo de dados distribuído, mantendo os especialistas residentes nas GPUs para melhorar a taxa de transferência e reduzir os custos de comunicação.

  • Um benchmark em oito GPUs NVIDIA B300 mostrou um MoE de 47 bilhões de parâmetros alcançando 52.000 tokens por segundo por GPU, representando um aumento de 2,7x em relação à implementação anterior.
  • Habilitar a precisão MXFP8 em quatro GPUs NVIDIA B300 aumentou a taxa de transferência de treinamento em aproximadamente 21% e reduziu a memória ativa máxima de 103 GiB para 95 GiB em comparação com o BF16.
  • O sistema suporta paralelismo de especialistas, pipeline e otimizador para distribuir os pesos do modelo e os estados de treinamento entre clusters de GPUs.
  • Os benchmarks demonstraram escalabilidade para um modelo de 1,2 trilhão de parâmetros com taxa de transferência de 858 TFLOP/s/GPU e configurações experimentais alcançando 2,38 trilhões de parâmetros.

A pilha de código aberto serve como base para a próxima geração de modelos Olmo e permite que pesquisadores treinem seus próprios grandes MoEs com maior flexibilidade.