Z.ai는 GLM-5 시리즈에서 처음 네이티브하게 다중 모달인 모델인 GLM-5.3-Flash를 출시했으며, 이는 총 3200억 개의 매개변수와 토큰당 180억 개의 활성 매개변수를 가진 전문가 혼합(MoE) 아키텍처를 특징으로 합니다. 이 모델은 1,048,576토큰 컨텍스트 창 내에서 이미지 및 비디오 입력을 지원하며 Hugging Face에서 MIT 라이선스로 제공됩니다.

  • KDA 선형 어텐션 레이어와 NoPE 희소 MLA 레이어를 결합한 하이브리드 어텐션을 채택하여 288개 전문가 중 8개로 토큰을 라우팅합니다.
  • IndexPool 메커니즘은 GLM-5.3과 비교하여 어텐션 연산량을 약 3배 줄이고 KV 캐시를 4.4배 축소시킵니다.
  • 벤치마크 결과 Terminal-Bench 2.1에서 84.3점, DeepSWE v1.1에서 63.4점을 기록하여 Claude Opus 4.8 근처의 성능을 보입니다.
  • API 가격은 입력 토큰당 $0.15/M, 출력 토큰당 $0.50/M로 설정되었으며, 자체 호스팅에는 약 306 GiB의 FP8 가중치가 필요합니다.

이 모델은 비용 효율적인 코딩 솔루션을 목표로 하며, 보고된 바에 따르면 내부 코딩 작업에서 높은 성능을 유지하면서 약 1/10의 가격으로 벤치마크 전반에 걸쳐 GLM-5.2를 능가합니다.