llama.cpp परियोजना ने अपने OpenVINO बैकएंड में महत्वपूर्ण अपडेट मर्ज किए हैं, जिनमें मुख्य रूप से Qwen3.5 मॉडल परिवार के लिए समर्थन सक्षम किया गया है और कई मेमोरी अनुकूलन तकनीकों को पेश किया गया है।
- GPT-OSS MoE, MXFP4, FILL, SIGMOID, SQR, SQRT और बहु-आयामी सेट पंक्तियों की क्रियाओं को सक्षम किया गया।
- Gemma3n, Phi-3-mini (NEOX RoPE), MPT, Kimi-linear, और Minimax-m3 आर्किटेक्चर में सटीकता संबंधी समस्याएं ठीक की गईं।
- GGML_OPENVINO_RELEASE_WEIGHTS को लागू किया गया ताकि कंपाइलेशन के बाद होस्ट वेट RSS छोड़ दिया जाए, जिससे Arc iGPU पर Llama-3.2-1B-Q4_K_M के लिए स्थिर अवस्था में मेमोरी उपयोग ~1555 MB से घटकर ~710 MB हो गया।
- कंपाइल-टाइम पीक RSS को कम करने के लिए स्ट्रीमिंग वेट रिक्वांटीज़ेशन जोड़ा गया, जिससे 1B मॉडलों के लिए 1.06 GB और 8B मॉडलों के लिए 2.0 GB की कमी आई।
- बार-बार लोड होने पर ग्राफ़ रूपांतरण और कंपाइलेशन को छोड़ने के लिए एक फ्रंटएंड मॉडल कैश (GGML_OPENVINO_MODEL_CACHE_DIR) पेश किया गया।
इन बदलावों से Qwen3.5 जैसे नए आर्किटेक्चर के साथ संगतता में सुधार हुआ है और GPU इनफरेंस के लिए अस्थायी कंपाइल-टाइम और स्थिर अवस्था दोनों में मेमोरी फुटप्रिंट महत्वपूर्ण रूप से कम हुए हैं।