llama.cpp प्रोजेक्ट ने build b11351 जारी किया, जिसने ggml बैकएंड बफ़र टाइप इंटरफ़ेस में नई विधियाँ पेश कीं। अपडेट में बफ़र आवंटन और आकार क्वेरी पर अधिक सूक्ष्म नियंत्रण की अनुमति देने के लिए `alloc_buffer_n` और `get_alloc_size_n` जोड़े गए हैं।

  • `ggml_backend_buft_alloc_buffer_n` सार्वजनिक API और संबंधित कॉलबैक को `ggml_backend_buffer_type_i` में जोड़ा गया।
  • `ggml_tallocr` के माध्यम से मल्टी-बफ़र विभाजन और टेंसर आवंटन के लिए डिफ़ॉल्ट हैंडलिंग लागू की गई।
  • टेंसर-टू-बफ़र योजना तर्क साझा करने के लिए वैकल्पिक `get_alloc_size_n` कॉलबैक जोड़ा गया।
  • डिफ़ॉल्ट कार्यान्वयन में अनचेक्ड realloc को std::vector से बदला गया।
  • अस्थायी `ggml_backend_meta_alloc_ctx_tensors_from_buft` फ़ंक्शन हटा दिया गया।

इस रिलीज़ में CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), NPU (Hexagon) और अन्य एक्सेलेरेटर के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान की गई हैं।