llama.cpp b11095 रिलीज़ ने HMX के लिए अनुकूलित GATED_DELTA_NET (GDN) का नया कार्यान्वयन पेश किया है, साथ ही Hexagon और Flash Attention kernels के लिए विभिन्न अनुकूलन भी हैं।
- GDN समर्थन में Qualcomm चिप्स पर प्रदर्शन बढ़ाने के लिए पाइपलाइनिंग, HVX थ्रेडिंग और वेक्टराइज्ड ऑपरेशन शामिल हैं।
- Flash Attention अपडेट्स रजिस्टर अकुम्यूलेशन और DMA पाइपलाइन सुधारों के माध्यम से टोकन जनरेशन के दौरान DDR पढ़ने को 20-30% कम करते हैं।
- इस रिलीज़ में CPU, CUDA, ROCm, Vulkan और OpenVINO बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान की गई हैं।
यह अपडेट विशिष्ट हार्डवेयर आर्किटेक्चर पर इनफरेंस दक्षता को बढ़ाता है जबकि मौजूदा डिप्लॉयमेंट वातावरण के साथ व्यापक संगतता बनाए रखता है।