AI2는 Trillion(조) 파라미터 규모까지 확장하면서도 계산 효율성을 유지하는 혼합 전문가(MoE) 모델을 위한 재설계된 오픈 학습 인프라인 Olmo-core 3를 출시했습니다. 이 프레임워크는 완전 샤딩 데이터 병렬화에서 분산 데이터 병렬화로 전환하여 GPU에 전문가를 상주시켜 처리량을 개선하고 통신 비용을 줄입니다.

  • NVIDIA B300 GPU 8개에서의 벤치마크 결과, 470억 파라미터 MoE가 GPU당 초당 52,000 토큰을 달성했으며, 이는 이전 구현 대비 2.7배 증가한 수치입니다.
  • NVIDIA B300 GPU 4개에서 MXFP8 정밀도를 활성화하면 BF16 대비 학습 처리량이 약 21% 증가하고 최대 활성 메모리가 103 GiB에서 95 GiB로 감소합니다.
  • 이 시스템은 모델 가중치와 학습 상태를 GPU 클러스터에 분산하기 위해 전문가, 파이프라인, 옵티마이저 병렬화를 지원합니다.
  • 벤치마크는 858 TFLOP/s/GPU 처리량을 갖춘 1.2조 파라미터 모델로의 확장성을 입증했으며, 실험적 구성에서는 2.38조 파라미터에 도달했습니다.

이 오픈소스 스택은 차세대 Olmo 모델의 기반을 제공하며, 연구자들이 더 큰 유연성으로 자체 대규모 MoE를 학습할 수 있도록 합니다.