즈푸 AI는 GLM-5 시리즈에서 네이티브하게 다중 모달인 첫 번째 모델이자 glm5_next 아키텍처의 첫 번째 오픈 가중치 릴리스인 GLM-5.3-Flash를 출시했습니다. 320B 파라미터 모델은 30T 토큰 다중 모달 코퍼스에서 학습되었으며, 긴 컨텍스트 서빙 비용을 줄이기 위해 하이브리드 희소 및 선형 어텐션 메커니즘을 특징으로 합니다.

  • 아키텍처: KDA 선형 어텐션과 DeepSeek 스타일의 희소 어텐션을 결합한 45개의 레이어로 구성되며, 확장 효율성을 위해 Manifold-Constrained Hyper-Connections(mHC)를 활용합니다.
  • 다중 모달 기능: 어휘에 이미지 및 비디오 토큰을 허용하는 24층 ViT 인코더를 갖추고 있으며, 최대 1,048,576 토큰의 컨텍스트 길이를 지원합니다.
  • 가중치: MIT 라이선스 하에 Hugging Face와 ModelScope에서 FP8(e4m3) 및 BF16 형식으로 제공됩니다.
  • 추론 지원: vLLM 및 SGLang에 대한 공식 레시피를 제공하며, 예측 디코딩 구성을 포함합니다.

이 릴리스는 코딩 및 에이전트 벤치마크에서 Claude Opus 4.8의 성능에 근접하면서도 추론 비용을 크게 줄이는 비용 효율적인 대안을 제공하는 것을 목표로 합니다.