LLaMA.cpp ने macOS, Linux, Android, Windows और openEuler के लिए कई आर्किटेक्चर पर b9729 संस्करण जारी किया है। इस रिलीज़ में CPU, Vulkan, OpenVINO, SYCL और ROCm समर्थन शामिल है, साथ ही एक नया UI पैकेज भी है। 'webui' के आंतरिक संदर्भ हटा दिए गए हैं।
LLaMA.cpp ने b9729 जारी किया: नए बाइनरी और प्लेटफ़ॉर्म समर्थन
llama.cpp Release b9741 में नए बाइनरी और समर्थन जोड़े गए
llama.cpp संस्करण b9741 macOS, Linux, Android, Windows, और openEuler के लिए कई आर्किटेक्चर पर नए बाइनरी पेश करता है। रिलीज में Vulkan, CUDA 12.4 और 13.3, OpenVINO, SYCL, और ROCm के लिए समर्थन शामिल है, साथ ही iOS और Ubuntu के लिए अपडेटेड संस्करण भी हैं।
ggml ने partition flattening के साथ AMX को अनुकूलित किया
ggml प्रोजेक्ट ने n_batch * M पर partition को flatten करके AMX प्रदर्शन को अनुकूलित किया, यह सुनिश्चित करते हुए कि सभी threads quantization में भाग लें। इस बदलाव से CPU और GPU प्लेटफॉर्म पर विभिन्न मॉडलों और हार्डवेयर कॉन्फ़िगरेशन के across गति 1.47x तक बढ़ी है, जिसमें inference time में स्थिर लाभ दिखाई दे रहे हैं।
ggml-webgpu ने Vulkan और NVIDIA के लिए F16 एडेप्टर टॉगल जोड़े
ggml-webgpu प्रोजेक्ट ने Vulkan और NVIDIA GPU पर अर्ध-सटीकता (F16) समर्थन के लिए एडेप्टर टॉगल जोड़े हैं। यह अपडेट macOS, Linux, Android, Windows और openEuler सहित कई प्लेटफ़ॉर्म पर संगत हार्डवेयर पर बेहतर प्रदर्शन सक्षम बनाता है, ARM और x64 आर्किटेक्चर के लिए विशिष्ट बिल्ड उपलब्ध हैं।
llama.cpp b9703 रिलीज़: अपडेट और बाइनरी डाउनलोड
llama.cpp संस्करण b9703 में सर्वर के प्रीसेट हैंडलिंग का पुनर्निर्माण शामिल है, जिसमें रिमोट HF प्रीसेट समर्थन और पुराने फ़ंक्शन हटा दिए गए हैं। रिलीज़ में macOS, Linux, Android, Windows और openEuler के लिए बाइनरी उपलब्ध कराए गए हैं, जो विभिन्न आर्किटेक्चर और Vulkan, CUDA, OpenVINO, और SYCL सहित हार्डवेयर त्वरण विकल्पों को कवर करते हैं।
Metal बैकएंड ने concat ऑपरेटर के लिए f16 और bf16 समर्थन जोड़ा
llama.cpp में Metal बैकएंड को concat ऑपरेटर के लिए f16 और bf16 टेंसर प्रकारों का समर्थन करने के लिए विस्तारित किया गया है, मौजूदा f32 और i32 समर्थन के अलावा। इस अपडेट में विशेष कुंजी टेम्पलेट, अपडेटेड पाइपलाइन गेटर्स, और बेहतर प्रकार-आधारित कुंजी डिस्पैच शामिल हैं, जिसमें pi:llama.cpp/Qwen3.6-27B की सहायता मिली।