Zai telah memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5. Model ini memiliki arsitektur hibrida yang menggabungkan perhatian jarang dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan kemampuan yang presisi.
- Model ini memiliki 320B parameter total dengan hanya 18B parameter aktif.
- Mengungguli GLM-5.2 di berbagai benchmark dengan harga sepersepuluhnya.
- Performa mendekati Claude Opus 4.8 pada benchmark pemrograman dan agen.
- Menggunakan Manifold-Constrained Hyper-Connections (mHC) untuk meningkatkan efisiensi skalabilitas.
- Dilatih pada korpus pra-pelatihan multimodal 30T token.
Model ini tersedia melalui Z.ai API Platform dan mendukung penyebaran dengan SGLang, vLLM, TokenSpeed, KTransformers, dan HLE.