AI2发布了Olmo-core 3,这是一种为混合专家(MoE)模型重新设计的开源训练基础设施,可在保持计算效率的同时扩展至万亿参数规模。该框架从完全分片数据并行切换到分布式数据并行,使专家驻留在GPU上以提高吞吐量并降低通信成本。
- 在八块NVIDIA B300 GPU上的基准测试显示,一个470亿参数的MoE模型每块GPU达到每秒52,000个token的吞吐量,较前一实现提升了2.7倍。
- 在四块NVIDIA B300 GPU上启用MXFP8精度使训练吞吐量提高了约21%,与BF16相比将峰值活跃内存从103 GiB降低至95 GiB。
- 该系统支持专家并行、流水线并行和优化器并行,以在GPU集群中分布模型权重和训练状态。
- 基准测试展示了可扩展至1.2万亿参数模型的能力,每块GPU达到858 TFLOP/s的吞吐量,实验配置甚至可达2.38万亿参数。
该开源堆栈作为下一代Olmo模型的基础,使研究人员能够以更灵活的方式训练自己的大型MoE模型。