El proyecto llama.cpp lanzó la compilación b11351, introduciendo nuevos métodos en la interfaz de tipo de búfer del backend ggml. La actualización añade `alloc_buffer_n` y `get_alloc_size_n` para permitir un control más granular sobre la asignación de búferes y la consulta de tamaños.

  • Se añadió la API pública `ggml_backend_buft_alloc_buffer_n` y el correspondiente callback a `ggml_backend_buffer_type_i`.
  • Se implementó el manejo predeterminado para la división en múltiples búferes y la asignación de tensores mediante `ggml_tallocr`.
  • Se añadió el callback opcional `get_alloc_size_n` para compartir la lógica de planificación tensor-a-búfer.
  • Se reemplazó el realloc sin comprobación por std::vector en la implementación predeterminada.
  • Se eliminó la función temporal `ggml_backend_meta_alloc_ctx_tensors_from_buft`.

Esta versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon) y otros aceleradores.