Proyek llama.cpp merilis build b11254, yang mencakup perbaikan mengenai cara tensor input dikumpulkan dalam grafik komputasi. Sebelumnya, `graph_inputs` diisi selama pemecahan grafik, menyebabkan masalah dengan paralelisme pipa di mana pergantian antar batch yang mengonsumsi input berbeda memicu perbandingan ID backend yang tidak benar dan memaksa reservasi ulang scheduler.

  • Perubahan ini mengumpulkan input setelah pemecahan dari semua daun input grafik, memastikan komposisi hanya bergantung pada keberadaan input daripada mana yang digunakan sebagai sumber.
  • Ini mencegah scheduler mencatat ukuran input yang lebih kecil (misalnya, `n_outputs = 0`) dan menghentikan eksekusi nanti melalui `GGML_SCHED_DEBUG_REALLOC`.
  • Rilis ini menyediakan biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, OpenCL, CUDA, Vulkan, OpenVINO, SYCL, ROCm), dan openEuler.

Perbaikan ini menstabilkan eksekusi dalam skenario paralelisme pipa dengan menghilangkan komposisi ulang grafik yang tidak perlu akibat perubahan urutan input.