llama.cpp प्रोजेक्ट ने बिल्ड b10076 जारी किया, जिसने CUDA बैकएंड में `get_rows` ऑपरेशन को int4 कॉपी का उपयोग करके वेक्टराइज़ करके प्रदर्शन अनुकूलन पेश किया। इस बदलाव से तत्व-दर-तत्व लूप से पंक्ति-अपरिवर्तनीय कार्य को बाहर निकाला गया है और एक वेक्टराइज़्ड पथ जोड़ा गया है जो समान प्रकार के सन्निहित डेटा के लिए प्रति थ्रेड 16 बाइट कॉपी करता है।
इस कार्यान्वयन को कंपाइल टाइम और रनटाइम पर गेट किया गया है, जिसमें सटीकता सुनिश्चित करने के लिए 16-बाइट एलाइनमेंट और विशिष्ट स्त्राइड शर्तों की आवश्यकता होती है। एक ऑक्यूपेंसी गेट छोटे सिंगल-रो gather को स्केलर पथ पर रखकर रגרेशन से बचाता है। Strix Halo (gfx1151) पर, इस अनुकूलन ने DeltaNet रिकरेंट-स्टेट gather की लेटेंसी को 18.6us से घटाकर 13.0us कर दिया।
रिलीज में CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL और OpenCL बैकएंड के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी शामिल हैं।