Le projet llama.cpp a publié la version b11351, introduisant de nouvelles méthodes dans l'interface du type de tampon du backend ggml. La mise à jour ajoute `alloc_buffer_n` et `get_alloc_size_n` pour permettre un contrôle plus fin de l'allocation des tampons et de la requête de taille.
- Ajout de l'API publique `ggml_backend_buft_alloc_buffer_n` et du callback correspondant à `ggml_backend_buffer_type_i`.
- Mise en œuvre du traitement par défaut pour le fractionnement multi-tampons et l'allocation de tenseurs via `ggml_tallocr`.
- Ajout du callback optionnel `get_alloc_size_n` pour partager la logique de planification des tenseurs vers les tampons.
- Remplacement du realloc non vérifié par std::vector dans l'implémentation par défaut.
- Suppression de la fonction temporaire `ggml_backend_meta_alloc_ctx_tensors_from_buft`.
Cette version fournit des binaires pour macOS, Linux, Windows, Android et openEuler sur CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon) et autres accélérateurs.