A AI2 lançou o Olmo-core 3, uma infraestrutura de treinamento aberta redesenhada para modelos mixture-of-experts (MoE) que escala até a faixa de trilhões de parâmetros enquanto mantém a eficiência computacional. O framework muda de paralelismo de dados totalmente fragmentado para paralelismo de dados distribuído, mantendo os especialistas residentes nas GPUs para melhorar a taxa de transferência e reduzir os custos de comunicação.
- Um benchmark em oito GPUs NVIDIA B300 mostrou um MoE de 47 bilhões de parâmetros alcançando 52.000 tokens por segundo por GPU, representando um aumento de 2,7x em relação à implementação anterior.
- Habilitar a precisão MXFP8 em quatro GPUs NVIDIA B300 aumentou a taxa de transferência de treinamento em aproximadamente 21% e reduziu a memória ativa máxima de 103 GiB para 95 GiB em comparação com o BF16.
- O sistema suporta paralelismo de especialistas, pipeline e otimizador para distribuir os pesos do modelo e os estados de treinamento entre clusters de GPUs.
- Os benchmarks demonstraram escalabilidade para um modelo de 1,2 trilhão de parâmetros com taxa de transferência de 858 TFLOP/s/GPU e configurações experimentais alcançando 2,38 trilhões de parâmetros.
A pilha de código aberto serve como base para a próxima geração de modelos Olmo e permite que pesquisadores treinem seus próprios grandes MoEs com maior flexibilidade.