Le projet llama.cpp a ajouté un support initial pour l'architecture du modèle GLM-5.3-Flash (GLM5-Next), y compris la migration vers une mémoire à index hybride et les premières capacités de Multi-Token Prediction (MTP).
- Le support initial de MTP a été ajouté, bien que retiré de la demande d'extraction initiale pour permettre un examen concentré.
- La disposition du k-pool est désormais conservée entre les ubatches pour éviter la péremption après les éditions de séquence et les démontages partagés.
- Les points de contrôle de rollback récurrent sont correctement écrits pour l'état conv et l'état delta net.
- Un bug dans le stride du stream build_attn_mha a été corrigé pour les requêtes non contiguës, garantissant un préremplissage multi-stream correct pour GLM5-Next.
- Les filtres de protection de quantification ont été nettoyés pour supprimer les entrées en double.
Ces modifications assurent une inférence stable et une gestion correcte de l'état pour les modèles GLM5-Next sur divers backends matériels, y compris CUDA, ROCm et CPU.