Ring-Zero escala el RL cero a 1T parámetros para razonamiento emergente
Los investigadores presentan Ring-Zero, una canalización de entrenamiento estable que escala el aprendizaje por refuerzo con recompensas verificables a modelos con un billón de parámetros, abordando problemas como la redundancia de tokens y la mala legibilidad encontrados en el escalado ingenuo.