Proyek llama.cpp telah merilis versi b11007, yang memperkenalkan dukungan untuk CUDA graphs dalam draf Multi-Token Prediction (MTP). Pembaruan ini meningkatkan efisiensi proses draf dengan memanfaatkan eksekusi CUDA graph.
- Mengaktifkan CUDA graph untuk draf MTP guna meningkatkan efisiensi penggunaan.
- Menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
- Menyertakan biner UI untuk semua platform yang didukung.
Rilis ini memungkinkan pengguna mendapatkan manfaat dari kinerja inferensi yang dioptimalkan pada GPU NVIDIA yang kompatibel melalui implementasi draf MTP baru.