llama.cpp के लिए ggml-openvino बैकएंड को संस्करण 2026.4.1 पर अपडेट किया गया है, जिसमें प्रदर्शन अनुकूलन, विस्तारित ऑपरेटर समर्थन और बेहतर डिवाइस गणना शामिल हैं।
- मिक्चर-ऑफ-एक्सपर्ट्स (MoE) राउटिंग और GDN QK नॉर्मलाइजेशन का फ्यूजन, जिसमें GPU MoE फ्यूजन डिफ़ॉल्ट रूप से सक्षम है।
- gemma-4 जैसे मॉडल्स में फ्यूज्ड गेट-अप वेट्स के लिए समर्थन, जिससे Arc B390 पर प्रिफिल थ्रूपुट 66.16 से बढ़कर 1608.73 t/s हो गया।
- स्टेटफुल एक्जीक्यूशन में रैंक-3 अक्ष हैंडलिंग के लिए सुधार, जिससे MoE मॉडल्स के लिए ग्राफ़ बिल्ड अबार्ट्स को हल किया गया।
- PRD-अनुपालन डिवाइस गणना और मेमोरी रिपोर्टिंग का कार्यान्वयन, जो GPU/IGGPU भेदभाव की सटीकता सुनिश्चित करता है।
- डिस्क से सीधे कंपाइल्ड मॉडल्स को आयात करने के लिए k-requant विकल्प q4_asym64 और cache_only मोड का संयोजन।
ये बदलाव MoE आर्किटेक्चर के लिए इनफ़रेंस प्रदर्शन में सुधार करते हैं और OpenVINO उपयोगकर्ताओं के लिए अधिक विश्वसनीय हार्डवेयर डिटेक्शन और कॉन्फ़िगरेशन प्रदान करते हैं।