Proyek llama.cpp telah menambahkan dukungan awal untuk arsitektur model GLM-5.3-Flash (GLM5-Next), termasuk migrasi ke memori indeks hibrida dan kemampuan Multi-Token Prediction (MTP) awal.
- Dukungan MTP awal ditambahkan, meskipun dihapus dari permintaan tarik awal untuk memungkinkan tinjauan yang fokus.
- Tata letak k-pool sekarang dipertahankan di antara ubatch untuk mencegah staleness setelah pengeditan urutan dan teardown bersama.
- Titik pemeriksaan rollback berulang ditulis dengan benar untuk state conv dan state delta net.
- Sebuah bug dalam stride stream build_attn_mha diperbaiki untuk kueri non-kontigu, memastikan prefill multi-stream yang benar untuk GLM5-Next.
- Filter perlindungan kuantisasi dibersihkan untuk menghapus entri duplikat.
Perubahan ini memastikan inferensi yang stabil dan manajemen state yang benar untuk model GLM5-Next di berbagai backend perangkat keras termasuk CUDA, ROCm, dan CPU.