O projeto llama.cpp lançou a compilação b11351, introduzindo novos métodos na interface de tipo de buffer do backend ggml. A atualização adiciona `alloc_buffer_n` e `get_alloc_size_n` para permitir um controle mais granular sobre o dimensionamento e a consulta do tamanho dos buffers.
- Adicionada a API pública `ggml_backend_buft_alloc_buffer_n` e o callback correspondente a `ggml_backend_buffer_type_i`.
- Implementado tratamento padrão para divisão de múltiplos buffers e alocação de tensores via `ggml_tallocr`.
- Adicionado callback opcional `get_alloc_size_n` para compartilhar a lógica de planejamento de mapeamento tensor-buffer.
- Substituído realloc sem verificação por std::vector na implementação padrão.
- Removida a função temporária `ggml_backend_meta_alloc_ctx_tensors_from_buft`.
Esta versão fornece binários para macOS, Linux, Windows, Android e openEuler em CPUs, GPUs (CUDA, Vulkan, ROCm, OpenCL), NPUs (Hexagon) e outros aceleradores.