AI2 a publié Olmo-core 3, une infrastructure d'entraînement open source redessinée pour les modèles mixture-of-experts (MoE) qui passe à l'échelle jusqu'à la plage des mille milliards de paramètres tout en maintenant l'efficacité computationnelle. Le framework passe de la parallélisation des données entièrement fragmentée à la parallélisation des données distribuée, gardant les experts résidents sur les GPU pour améliorer le débit et réduire les coûts de communication.
- Un benchmark sur huit NVIDIA B300 GPUs a montré un MoE de 47 milliards de paramètres atteignant 52 000 tokens par seconde par GPU, représentant une augmentation de 2,7x par rapport à l'implémentation précédente.
- L'activation de la précision MXFP8 sur quatre NVIDIA B300 GPUs a augmenté le débit d'entraînement d'environ 21 % et réduit la mémoire active maximale de 103 GiB à 95 GiB par rapport à BF16.
- Le système prend en charge la parallélisation des experts, du pipeline et de l'optimiseur pour distribuer les poids du modèle et les états d'entraînement sur des clusters de GPU.
- Les benchmarks ont démontré une scalabilité jusqu'à un modèle de 1,2 mille milliards de paramètres avec un débit de 858 TFLOP/s/GPU et des configurations expérimentales atteignant 2,38 mille milliards de paramètres.
La pile open source sert de fondation à la prochaine génération de modèles Olmo et permet aux chercheurs d'entraîner leurs propres grands MoE avec plus de flexibilité.