Proyek llama.cpp merilis build b11254, yang mencakup perbaikan mengenai cara tensor input dikumpulkan dalam grafik komputasi. Sebelumnya, `graph_inputs` diisi selama pemecahan grafik, menyebabkan masalah dengan paralelisme pipa di mana pergantian antar batch yang mengonsumsi input berbeda memicu perbandingan ID backend yang tidak benar dan memaksa reservasi ulang scheduler.
- Perubahan ini mengumpulkan input setelah pemecahan dari semua daun input grafik, memastikan komposisi hanya bergantung pada keberadaan input daripada mana yang digunakan sebagai sumber.
- Ini mencegah scheduler mencatat ukuran input yang lebih kecil (misalnya, `n_outputs = 0`) dan menghentikan eksekusi nanti melalui `GGML_SCHED_DEBUG_REALLOC`.
- Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.
Perbaikan ini menstabilkan eksekusi dalam skenario paralelisme pipa dengan menghilangkan komposisi ulang grafik yang tidak perlu akibat perubahan urutan input.