El proyecto llama.cpp lanzó la compilación b10782, que aborda un problema crítico en el backend de CUDA para configuraciones con múltiples GPU. La actualización permite flujos concurrentes por división y habilita que la optimización de gráficos CUDA se ejecute correctamente en múltiples dispositivos.
- Corrige un error donde los eventos de CUDA se vinculaban incorrectamente a la GPU que estaba activa durante la creación, lo que hacía que se omitiera la optimización de gráficos para múltiples GPU.
- Implementa el ajuste explícito del dispositivo mediante `ggml_cuda_set_device` para garantizar que las optimizaciones se apliquen a la división correcta por dispositivo.
- La corrección está activa solo cuando `GGML_CUDA_GRAPH_OPT=1` está habilitado; el comportamiento predeterminado permanece sin cambios.
Este cambio asegura que la optimización de gráficos se ejecute una vez por división en lugar de ser omitida, permitiendo que la inferencia con múltiples GPU utilice correctamente la aceleración CUDA.