Le projet llama.cpp a publié la version b11254, qui inclut une correction concernant la manière dont les tenseurs d'entrée sont collectés dans le graphe de calcul. Auparavant, `graph_inputs` était peuplé lors du fractionnement du graphe, ce qui provoquait des problèmes avec le parallélisme de pipeline où la commutation entre des lots consommant différentes entrées entraînait des comparaisons d'ID backend erronées et forçait des réréservations du planificateur.
- Le changement collecte les entrées après le fractionnement à partir de toutes les feuilles d'entrée du graphe, garantissant que la composition dépend uniquement de la présence des entrées plutôt que de celles utilisées comme sources.
- Cela empêche le planificateur d'enregistrer des tailles d'entrée plus petites (par exemple, `n_outputs = 0`) et d'interrompre ultérieurement via `GGML_SCHED_DEBUG_REALLOC`.
- La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
Cette correction stabilise l'exécution dans les scénarios de parallélisme de pipeline en éliminant les recompositions de graphe inutiles causées par les changements d'ordre des entrées.