Proyek llama.cpp merilis build b11351, memperkenalkan metode baru ke antarmuka tipe buffer backend ggml. Pembaruan ini menambahkan `alloc_buffer_n` dan `get_alloc_size_n` untuk memungkinkan kontrol yang lebih granular atas alokasi buffer dan kueri ukuran.
- Menambahkan API publik `ggml_backend_buft_alloc_buffer_n` dan callback terkait ke `ggml_backend_buffer_type_i`.
- Mengimplementasikan penanganan default untuk pemecahan multi-buffer dan alokasi tensor melalui `ggml_tallocr`.
- Menambahkan callback `get_alloc_size_n` opsional untuk berbagi logika perencanaan tensor-ke-buffer.
- Mengganti realloc yang tidak diverifikasi dengan std::vector dalam implementasi default.
- Menghapus fungsi sementara `ggml_backend_meta_alloc_ctx_tensors_from_buft`.
Rilis ini menyediakan biner untuk macOS, Linux, Windows, Android, dan openEuler di seluruh CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon), dan akselerator lainnya.