llama.cpp प्रोजेक्ट ने बिल्ड b11266 जारी किया, जिसमें एक Vulkan अनुकूलन शामिल है जो F32 A मैट्रिक्स को 2-अलाइन होने पर एक बार में दो तत्व लोड करता है। यह बदलाव Intel हार्डवेयर पर प्रदर्शन समस्याओं को दूर करता है जहाँ फ्लोट्स को एक-एक करके लोड करना अक्षम है, और यह मूल पैच में `a_offset` अलाइनमेंट के लिए अनुपलब्ध सत्यापन को भी ठीक करता है।

  • संशोधन Intel BMG आर्किटेक्चर पर थ्रूपुट बढ़ाने के लिए `mul_mat_vec` में मौजूद 2-अलाइन लोड तर्क का लाभ उठाता है।
  • एक Intel B60 पर बेंचमार्क परिणाम विशिष्ट मैट्रिक्स गुणा आकारों के लिए महत्वपूर्ण गति वृद्धि दिखाते हैं, जिसमें एक टेस्ट केस के लिए प्रदर्शन 153.08 GFLOPS से बढ़कर 221.66 GFLOPS हो जाता है और दूसरे के लिए 1.63 TFLOPS तक पहुँच जाता है।
  • इस रिलीज में macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, CUDA, ROCm, OpenVINO, SYCL, Snapdragon), Android, Windows, और openEuler के लिए बाइनरी प्रदान किए गए हैं।

यह अपडेट फ्लोटिंग-पॉइंट मैट्रिक्स ऑपरेशन्स के लिए मेमोरी एक्सेस पैटर्न को अनुकूलित करके Vulkan बैकएंड का उपयोग करते हुए Intel GPUs पर इनफरेंस प्रदर्शन को बेहतर बनाता है।