Zhipu AI telah merilis GLM-5.3-Flash, model multimodal asli pertama dalam seri GLM-5 dan rilis bobot terbuka pertama dari arsitektur glm5_next. Model dengan 320B parameter ini dilatih pada korpus multimodal berukuran 30T token dan memiliki mekanisme perhatian hibrida yang menggabungkan pendekatan sparse dan linear untuk mengurangi biaya penyajian konteks panjang.
- Arsitektur: 45 lapisan yang menggabungkan perhatian linear KDA dengan perhatian sparse bergaya DeepSeek, memanfaatkan Hyper-Koneksi Terbatas Manifold (mHC) untuk efisiensi skalabilitas.
- Kemampuan multimodal: Encoder ViT berlapis 24 memungkinkan token gambar dan video dalam kosakata, mendukung panjang konteks hingga 1.048.576 token.
- Bobot: Tersedia dalam format FP8 (e4m3) dan BF16 di Hugging Face dan ModelScope dengan lisensi MIT.
- Dukungan inferensi: Resep resmi disediakan untuk vLLM dan SGLang, termasuk konfigurasi decoding spekulatif.
Rilis ini bertujuan menawarkan alternatif yang hemat biaya yang mendekati kinerja Claude Opus 4.8 pada benchmark pemrograman dan agentic sambil secara signifikan mengurangi biaya inferensi.