Le projet llama.cpp a publié la version b10737, qui corrige des bugs critiques dans le support de l'architecture qwen4exp. La mise à jour résout les problèmes de persistance de l'état de séquence et empêche les aborts CUDA lors du chargement du modèle.
- Corrige l'effondrement NaN de kvu et restaure les données du cache indexeur ext.x/ext.y lors des aller-retours de sauvegarde/restauration pour les modèles qwen4exp.
- Corrige la dérivation du nombre de lignes par_layer_token_embd et rejette les déréférencements de pointeur null dans les couches de cache récurrentes PLE.
- Désactive le drapeau de tenseur -sm pour qwen4exp, qui causait précédemment des logits NaN et des plantages sur les appareils réels.
- Renomme seq_set en seq_get_all pour résoudre les conflits de surcharge de fonctions et ajoute des tests vérifiant l'intégrité de l'état.
Ces modifications garantissent que les modèles qwen4exp peuvent être chargés et sauvegardés sans corruption de données ni erreurs d'exécution, en particulier lors de l'utilisation du contenu mrope 2D ou des couches PLE.