AI2 telah merilis Olmo-core 3, infrastruktur pelatihan open-source yang didesain ulang untuk model mixture-of-experts (MoE) yang dapat diskalakan hingga rentang triliunan parameter sambil mempertahankan efisiensi komputasi. Kerangka kerja ini beralih dari data parallelism ter-shard sepenuhnya ke distributed data parallelism, dengan menjaga para ahli tetap berada di GPU untuk meningkatkan throughput dan mengurangi biaya komunikasi.
- Sebuah benchmark pada delapan GPU NVIDIA B300 menunjukkan MoE 47-miliar-parameter mencapai 52.000 tok/s per GPU, mewakili peningkatan 2,7x dibandingkan implementasi sebelumnya.
- Mengaktifkan presisi MXFP8 pada empat GPU NVIDIA B300 meningkatkan throughput pelatihan sekitar 21% dan mengurangi memori aktif puncak dari 103 GiB menjadi 95 GiB dibandingkan BF16.
- Sistem ini mendukung parallelism ahli, pipeline, dan optimizer untuk mendistribusikan bobot model dan keadaan pelatihan di seluruh kluster GPU.
- Benchmark menunjukkan skalabilitas hingga model 1,2-triliun-parameter dengan throughput 858 TFLOP/s/GPU dan konfigurasi eksperimental mencapai 2,38 triliun parameter.
Stack open-source ini menjadi fondasi untuk generasi berikutnya dari model Olmo dan memungkinkan peneliti melatih MoE besar mereka sendiri dengan fleksibilitas yang lebih besar.