Proyek llama.cpp merilis build b10782, yang menangani masalah kritis di backend CUDA untuk pengaturan multi-GPU. Pembaruan ini memungkinkan stream konkuren per split dan mengaktifkan optimisasi grafik CUDA agar berjalan dengan benar di beberapa perangkat.

  • Memperbaiki bug di mana event CUDA secara salah terikat ke GPU yang aktif saat pembuatan, menyebabkan optimisasi grafik multi-GPU dilewati.
  • Mengimplementasikan pengaturan perangkat eksplisit melalui `ggml_cuda_set_device` untuk memastikan optimisasi diterapkan pada split yang benar per perangkat.
  • Perbaikan ini hanya aktif ketika `GGML_CUDA_GRAPH_OPT=1` diaktifkan; perilaku default tetap tidak berubah.

Perubahan ini memastikan bahwa optimisasi grafik berjalan sekali per split alih-alih dilewati, memungkinkan inferensi multi-GPU memanfaatkan akselerasi CUDA dengan benar.