Huawei는 Ascend 하드웨어에서 훈련된 Mixture of Experts (MoE) 대규모 언어 모델인 openPangu-2.0-Pro의 오픈소스 가중치를 출시했습니다. 이 모델은 총 5050억 개의 매개변수와 180억 개의 활성화된 매개변수를 가지며 512k 토큰의 컨텍스트 길이를 지원합니다.

  • 전체 사전 훈련 데이터는 34T 토큰으로 구성됩니다.
  • 사후 훈련은 느린 사고와 빠른 사고 기능을 갖춘 통합 SFT를 사용합니다.
  • 훈련에는 여러 RL 전문가를 결합한 온-정책 증류와 여러 전문 RL 훈련이 포함됩니다.

모델의 기술적 세부 사항은 openPangu-2.0 기술 보고서에 문서화되어 있습니다.