Le projet llama.cpp a publié la compilation b11009, qui résout des problèmes critiques avec l'état divisé et les calculs de granularité pour les couches d'attention QKV fusionnées.

  • Le code du modèle calcule désormais correctement les états divisés pour attn_qkv en fonction de n_head * n_embd_head_k, résolvant les problèmes de compatibilité avec les modèles gemma4 utilisant le drapeau --fuse-qkv où n_embd est 5376 mais Q est 8192.
  • Le support des couches d'attention complète fusionnées a été ajouté pour les architectures qwen35 et qwen35moe.
  • Une balise TODO [TAG_SPLIT_QGATE_QWEN] a été ajoutée pour suivre le travail supplémentaire sur la division de QGate pour les modèles Qwen.

Cette version garantit que des configurations spécifiques du modèle, en particulier celles impliquant des opérations QKV fusionnées dans gemma4 et qwen35, fonctionnent correctement sans erreurs de calcul d'état.