O projeto llama.cpp lançou a compilação b10782, que aborda um problema crítico no backend CUDA para configurações com múltiplas GPUs. A atualização permite streams concorrentes por divisão e habilita a otimização de gráficos CUDA para funcionar corretamente em vários dispositivos.

  • Corrige um bug onde eventos CUDA eram vinculados incorretamente à GPU que estava ativa durante a criação, fazendo com que a otimização de gráficos para múltiplas GPUs fosse ignorada.
  • Implementa a configuração explícita do dispositivo via `ggml_cuda_set_device` para garantir que as otimizações se apliquem à divisão correta por dispositivo.
  • A correção está ativa apenas quando `GGML_CUDA_GRAPH_OPT=1` está habilitado; o comportamento padrão permanece inalterado.

Esta alteração garante que a otimização de gráficos seja executada uma vez por divisão, em vez de ser contornada, permitindo que a inferência com múltiplas GPUs utilize a aceleração CUDA corretamente.