AI2 выпустила Olmo-core 3, переработанную открытую инфраструктуру обучения для моделей mixture-of-experts (MoE), которая масштабируется до диапазона триллионов параметров, сохраняя вычислительную эффективность. Фреймворк переключается с полностью фрагментированного параллелизма данных на распределенный параллелизм данных, оставляя экспертов резидентными на GPU для повышения пропускной способности и снижения затрат на коммуникацию.

  • Бенчмарк на восьми GPU NVIDIA B300 показал, что MoE с 47 миллиардами параметров достигает 52 000 токенов в секунду на GPU, что представляет собой увеличение в 2,7 раза по сравнению с предыдущей реализацией.
  • Включение точности MXFP8 на четырех GPU NVIDIA B300 увеличило пропускную способность обучения примерно на 21% и снизило пиковое активное потребление памяти с 103 GiB до 95 GiB по сравнению с BF16.
  • Система поддерживает параллелизм экспертов, конвейерный параллелизм и параллелизм оптимизаторов для распределения весов модели и состояний обучения по кластерам GPU.
  • Бенчмарки продемонстрировали масштабируемость до модели с 1,2 триллиона параметров с пропускной способностью 858 TFLOP/s/GPU, а экспериментальные конфигурации достигли 2,38 триллионов параметров.

Стек с открытым исходным кодом служит основой для следующего поколения моделей Olmo и позволяет исследователям обучать свои собственные большие MoE с большей гибкостью.