Proyek llama.cpp merilis build b11306, yang menangani crash akibat perubahan bentuk grafik selama decoding. Pembaruan ini mengubah penanganan flag `causal_attn` untuk mencegah kegagalan realokasi di bawah batasan penjadwalan tertentu.

  • Setelah decode perangkat, `causal_attn` dimatikan untuk separuh ubatch dan kemudian dihidupkan kembali untuk sisa batch untuk memastikan jumlah node yang konsisten.
  • Perubahan ini mencegah grafik melakukan realokasi pada ukuran yang tidak berubah, yang sebelumnya menyebabkan abort eksekusi ketika `GGML_SCHED_NO_REALLOC` aktif.
  • Perbaikan ini berlaku untuk arsitektur decode tetapi dilewati untuk arsitektur encode.

Rilis ini mencakup biner untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, CUDA 12/13, ROCm 10.0, OpenVINO, SYCL, Snapdragon), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 10.0), dan openEuler.