Proyek llama.cpp merilis build b10782, yang menangani masalah kritis di backend CUDA untuk pengaturan multi-GPU. Pembaruan ini memungkinkan stream konkuren per split dan mengaktifkan optimisasi grafik CUDA agar berjalan dengan benar di beberapa perangkat.
- Memperbaiki bug di mana event CUDA secara salah terikat ke GPU yang aktif saat pembuatan, menyebabkan optimisasi grafik multi-GPU dilewati.
- Mengimplementasikan pengaturan perangkat eksplisit melalui `ggml_cuda_set_device` untuk memastikan optimisasi diterapkan pada split yang benar per perangkat.
- Perbaikan ini hanya aktif ketika `GGML_CUDA_GRAPH_OPT=1` diaktifkan; perilaku default tetap tidak berubah.
Perubahan ini memastikan bahwa optimisasi grafik berjalan sekali per split alih-alih dilewati, memungkinkan inferensi multi-GPU memanfaatkan akselerasi CUDA dengan benar.