AI2は、混合専門家(MoE)モデル向けの再設計されたオープンなトレーニングインフラストラクチャであるOlmo-core 3をリリースしました。これは、計算効率を維持しながらトリリンパラメータの範囲にスケーリングします。このフレームワークは、完全にシャードされたデータ並列処理から分散データ並列処理へ切り替え、GPU上で専門家を常駐させることでスループットを向上させ、通信コストを削減します。
- 8つのNVIDIA B300 GPUでのベンチマークでは、470億パラメータのMoEがGPUあたり秒間52,000トークンを達成し、以前の処理実装と比較して2.7倍の増加を示しました。
- 4つのNVIDIA B300 GPUでMXFP8精度を有効にすることで、トレーニングのスループットは約21%向上し、BF16と比較してピークアクティブメモリが103 GiBから95 GiBに削減されました。
- このシステムは、専門家の並列処理、パイプラインの並列処理、オプティマイザの並列処理をサポートし、モデルの重みとトレーニング状態をGPUクラスター全体に分散します。
- ベンチマークでは、858 TFLOP/s/GPUのスループットを持つ1.2兆パラメータのモデルへのスケーラビリティが実証され、実験的な構成では2.38兆パラメータに達しました。
このオープンソーススタックは、次世代のOlmoモデルの基盤として機能し、研究者がより大きな柔軟性を持って独自の大型MoEをトレーニングすることを可能にします。