llama.cpp 프로젝트는 다중 GPU 설정에서 CUDA 백엔드에 대한 중요한 문제를 해결하는 빌드 b10782를 출시했습니다. 이 업데이트는 분할당 동시 스트림을 허용하고 여러 장치 간에 CUDA 그래프 최적화가 올바르게 실행되도록 합니다.
- 생성 시 활성 상태였던 GPU에 CUDA 이벤트가 잘못 바인딩되어 다중 GPU 그래프 최적화가 건너뛰어지는 버그를 수정했습니다.
- `ggml_cuda_set_device`를 통해 명시적인 디바이스 설정을 구현하여 각 디바이스에 대해 올바른 분할에 최적화가 적용되도록 보장합니다.
- 이 수정은 `GGML_CUDA_GRAPH_OPT=1`이 활성화된 경우에만 적용되며, 기본 동작은 변경되지 않습니다.
이 변경으로 인해 그래프 최적화가 건너뛰어지는 대신 분할당 한 번 실행되어 다중 GPU 추론이 CUDA 가속을 올바르게 활용할 수 있게 됩니다.