Проект llama.cpp выпустил сборку b10782, которая устраняет критическую проблему в бэкенде CUDA для конфигураций с несколькими GPU. Обновление позволяет создавать параллельные потоки на каждый раздел и корректно запускать оптимизацию CUDA-графов на нескольких устройствах.
- Исправлена ошибка, при которой события CUDA неправильно привязывались к GPU, активному в момент создания, из-за чего оптимизация графов для нескольких GPU пропускалась.
- Реализована явная установка устройства через `ggml_cuda_set_device`, чтобы гарантировать применение оптимизаций к правильному разделу на каждом устройстве.
- Исправление работает только при включенном `GGML_CUDA_GRAPH_OPT=1`; поведение по умолчанию не изменилось.
Это изменение гарантирует, что оптимизация графов выполняется один раз для каждого раздела, а не обходится, позволяя инференсу на нескольких GPU правильно использовать ускорение CUDA.