Zai telah memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5. Model ini memiliki arsitektur hibrida yang menggabungkan perhatian jarang dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan kemampuan yang presisi.

  • Model ini memiliki 320B parameter total dengan hanya 18B parameter aktif.
  • Mengungguli GLM-5.2 di berbagai benchmark dengan harga sepersepuluhnya.
  • Performa mendekati Claude Opus 4.8 pada benchmark pemrograman dan agen.
  • Menggunakan Manifold-Constrained Hyper-Connections (mHC) untuk meningkatkan efisiensi skalabilitas.
  • Dilatih pada korpus pra-pelatihan multimodal 30T token.

Model ini tersedia melalui Z.ai API Platform dan mendukung penyebaran dengan SGLang, vLLM, TokenSpeed, KTransformers, dan HLE.