llama.cpp b10981 रिलीज ने OpenVINO बैकएंड की स्टेटफुल डिकोडिंग पथ में गंभीर सटीकता समस्याओं को दूर किया, विशेष रूप से उन मॉडल्स जैसे Gemma-4 के लिए समर्थन ठीक किया जो पर-लेयर हेड साइज का उपयोग करते हैं। यह GPU मिक्स्चर ऑफ एक्सपर्ट्स (MoE) इनफरेंस के लिए अनुकूलन भी पेश करता है और KV स्टेट रिलेआउट्स के माध्यम से प्रदर्शन में सुधार करता है।
- पर-लेयर-टाइप हेड काउंट्स और स्लाइविंग-विंडर लेयर्स को सही ढंग से संभालकर Gemma-4 के लिए स्टेटफुल डिकोड विफलताओं को ठीक किया।
- GPU पर स्टेटफुल डिकोडिंग प्रदर्शन में सुधार, जहाँ gemma-4-12B की गति गहराई 8192 पर 6.27 से बढ़कर 9.11 t/s हो गई।
- 4-बिट रीक्वांट टारगेट चुनने के लिए GGML_OPENVINO_REQUANT_KQUANT और वजन बफर्स को डिस्क पर स्पाइल करने के लिए GGML_OPENVINO_SPILL_DIR का समर्थन जोड़ा।
- एक्सपर्ट ब्लॉक को MOECompressed में फ्यूज करके और ग्रुप्ड 8-बिट एक्सपर्ट्स को रीक्वांट करके GPU MoE इनफरेंस को अनुकूलित किया।
- पैक्ड QKV RoPE व्यूज़ को स्वीकार करके और मास्क्स से कैशलेस अटेंशन का पता लगाकर NPU पर कैशलेस एनकोडर मॉडल्स सक्षम किए।
- असंगत ऑपरेंड टाइप्स को f32 में अपकास्ट करके मिक्स्ड-डाटाटाइप ADD/SWIGLU_CLAMP ऑपरेशन्स को ठीक किया ताकि सटीकता बनी रहे।
ये बदलाव Gemma-4 जटिल मॉडल आर्किटेक्चर के लिए सटीक इनफरेंस सुनिश्चित करते हैं, साथ ही संगत हार्डवेयर पर स्टेटफुल डिकोडिंग और MoE वर्कलोड्स के लिए मापनीय स्पीडअप प्रदान करते हैं।