ZhiPu memperkenalkan GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5, yang menggunakan arsitektur hibrida yang menggabungkan perhatian sparse dan linear untuk mengurangi biaya layanan konteks panjang sambil mempertahankan presisi.
Model ini menggunakan 320B total parameter dengan hanya 18B parameter aktif, mencapai kinerja yang melampaui GLM-5.2 di berbagai benchmark dan mendekati Claude Opus 4.8 dalam tugas pemrograman dengan sepersepuluh harga. Inovasi teknis utama termasuk Manifold-Constrained Hyper-Connections (mHC) untuk meningkatkan efisiensi skalabilitas dan model dasar baru yang dilatih dioptimalkan seputar kemampuan dan efisiensi.
GLM-5.3-Flash tersedia melalui Platform API Z.ai dan mendukung penyebaran melalui framework termasuk SGLang, vLLM, TokenSpeed, KTransformers, dan HLE.