Z.ai telah merilis GLM-5.3-Flash, model multimoda asli pertama dalam seri GLM-5, yang menampilkan arsitektur mixture-of-experts dengan total 320 miliar parameter dan 18 miliar aktif per token. Model ini mendukung input gambar dan video dalam jendela konteks 1.048.576 token dan tersedia di bawah lisensi MIT di Hugging Face.

  • Menggunakan perhatian hibrida yang menggabungkan lapisan linear-attention KDA dengan lapisan MLA sparse NoPE, merutekan token melalui 8 dari 288 ahli.
  • Mekanisme IndexPool mengurangi komputasi perhatian sekitar 3x dan memperkecil cache KV sebesar 4.4x dibandingkan GLM-5.3.
  • Benchmark menunjukkan skor 84.3 pada Terminal-Bench 2.1 dan 63.4 pada DeepSWE v1.1, menempatkannya dekat dengan Claude Opus 4.8.
  • Harga API ditetapkan di $0,15/M untuk token input dan $0,50/M untuk token output, dengan self-hosting memerlukan sekitar 306 GiB bobot FP8.

Model ini bertujuan menyediakan solusi pemrograman yang hemat biaya, dilaporkan mengalahkan GLM-5.2 di berbagai benchmark dengan harga sekitar sepersepuluh sambil mempertahankan kinerja tinggi pada tugas pemrograman internal.