Proyek llama.cpp merilis build b11351, memperkenalkan metode baru ke antarmuka tipe buffer backend ggml. Pembaruan ini menambahkan `alloc_buffer_n` dan `get_alloc_size_n` untuk memungkinkan kontrol yang lebih granular atas alokasi buffer dan kueri ukuran.

  • Menambahkan API publik `ggml_backend_buft_alloc_buffer_n` dan callback terkait ke `ggml_backend_buffer_type_i`.
  • Mengimplementasikan penanganan default untuk pemecahan multi-buffer dan alokasi tensor melalui `ggml_tallocr`.
  • Menambahkan callback `get_alloc_size_n` opsional untuk berbagi logika perencanaan tensor-ke-buffer.
  • Mengganti realloc yang tidak diverifikasi dengan std::vector dalam implementasi default.
  • Menghapus fungsi sementara `ggml_backend_meta_alloc_ctx_tensors_from_buft`.

Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon), dan akselerator lainnya.