Huawei ha publicado los pesos de código abierto para openPangu-2.0-Pro, un modelo de lenguaje grande (LLM) de Mezcla de Expertos (MoE) entrenado en hardware Ascend. El modelo cuenta con 505 mil millones de parámetros totales y 18 mil millones de parámetros activados, y admite una longitud de contexto de 512k tokens.
- Los datos totales de preentrenamiento constan de 34T tokens.
- El postentrenamiento utiliza SFT unificado con capacidades de pensamiento lento y rápido.
- El entrenamiento incluye múltiples especializaciones de entrenamiento RL y destilación on-policy que combina múltiples especialistas en RL.
Los detalles técnicos del modelo están documentados en el Informe Técnico de openPangu-2.0.