Z.ai는 GLM-5.3을 출시했으며, 이는 기본 모델이나 매개변수 수를 변경하지 않고도 사후 학습 확장이 장기 추론에서 상당한 이점을 가져온다는 것을 보여주는 통제 실험입니다.

이번 릴리스는 GLM-5.2와 동일한 아키텍처 및 총/활성화 매개변수를 유지하면서 장기 환경과 강화 학습에 대한 1개월간의 확장을 추가합니다. 저자들은 복잡한 추론 체인을 처리하는 것과 같은 능력에 대해 매개변수 수보다 효과적인 깊이와 사후 학습이 이제 더 중요하다고 주장합니다. 확률 법칙은 훈련 컴퓨팅 최적화에서 데이터, 컴퓨팅 및 추론 비용의 균형으로 이동했으며, 작업별로 매개변수당 최적 토큰 수가 다릅니다.

이 접근 방식은 Z.ai가 모델 크기를 늘리지 않고 특정 능력을 개선할 수 있게 하며, 기본 모델 확장은 향후 반복 작업을 위해 예약됩니다.