Le projet llama.cpp a publié la version b10782, qui résout un problème critique dans le backend CUDA pour les configurations multi-GPU. La mise à jour permet des flux concurrents par partition et active l'optimisation des graphes CUDA pour fonctionner correctement sur plusieurs appareils.
- Corrige un bug où les événements CUDA étaient incorrectement liés au GPU actif lors de la création, ce qui entraînait le saut de l'optimisation des graphes multi-GPU.
- Implémente le réglage explicite de l'appareil via `ggml_cuda_set_device` pour garantir que les optimisations s'appliquent à la partition correcte par appareil.
- La correction n'est active que lorsque `GGML_CUDA_GRAPH_OPT=1` est activé ; le comportement par défaut reste inchangé.
Ce changement garantit que l'optimisation des graphes s'exécute une fois par partition au lieu d'être contournée, permettant à l'inférence multi-GPU d'utiliser correctement l'accélération CUDA.