Le projet llama.cpp a publié la version b11306, qui résout un plantage causé par des changements de forme du graphe pendant le décodage. La mise à jour modifie la gestion du drapeau `causal_attn` pour empêcher les échecs de réallocation sous des contraintes d'ordonnancement spécifiques.
- Après le décodage sur appareil, `causal_attn` est désactivé pour la moitié de l'ubatch puis réactivé pour le reste afin d'assurer un nombre constant de nœuds.
- Ce changement empêche le graphe de se réallocation à une taille inchangée, ce qui précédemment interrompait l'exécution lorsque `GGML_SCHED_NO_REALLOC` était actif.
- La correction s'applique aux architectures de décodage mais est ignorée pour les architectures de codage.
La version inclut des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0) et openEuler.