A Huawei lançou os pesos de código aberto para o openPangu-2.0-Pro, um modelo de linguagem grande (LLM) Mixture of Experts (MoE) treinado em hardware Ascend. O modelo possui 505 bilhões de parâmetros totais com 18 bilhões de parâmetros ativados e suporta um comprimento de contexto de 512k tokens.
- Os dados totais de pré-treinamento consistem em 34T tokens.
- O pós-treinamento utiliza SFT unificado com capacidades de pensamento lento e rápido.
- O treinamento inclui múltiplos treinamentos RL especializados e destilação on-policy combinando múltiplos especialistas em RL.
Os detalhes técnicos do modelo estão documentados no Relatório Técnico do openPangu-2.0.