Проект llama.cpp выпустил сборку b11351, внедрив новые методы в интерфейс типа буфера бэкенда ggml. Обновление добавляет `alloc_buffer_n` и `get_alloc_size_n` для более детального контроля над выделением буфера и запросом его размера.
- Добавлен публичный API `ggml_backend_buft_alloc_buffer_n` и соответствующий коллбэк в `ggml_backend_buffer_type_i`.
- Реализована обработка по умолчанию для разделения на несколько буферов и выделения тензоров через `ggml_tallocr`.
- Добавлен необязательный коллбэк `get_alloc_size_n` для совместного использования логики планирования сопоставления тензоров с буферами.
- В реализации по умолчанию unchecked realloc заменён на std::vector.
- Удалена временная функция `ggml_backend_meta_alloc_ctx_tensors_from_buft`.
Этот релиз предоставляет бинарные файлы для macOS, Linux, Windows, Android и openEuler для CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon) и других ускорителей.