llama.cpp प्रोजेक्ट ने बिल्ड b10829 जारी किया, जिसने गेटेड डेल्टा नेट (GDN) क्वेरी/की नॉर्मलाइज़ेशन इम्प्लीमेंटेशन को सुधारा। यह बदलाव `max` का उपयोग करने से `rsqrt` की ओर नॉर्मलाइज़ेशन विधि को बदलता है, जो flash-linear-attention द्वारा उपयोग किए गए परिभाषा के साथ संरेखित होता है।
- GDN q/k नॉर्मलाइज़ेशन अब flash-linear-attention द्वारा परिभाषित `l2norm` का उपयोग करता है: `x * rsqrt(sum(x*x) + eps)`।
- पहले, llama.cpp ने `ggml_l2_norm` का उपयोग किया था, जिसने रूट के अंदर एप्सिलॉन रखने के बजाय `max(sqrt(sum(x*x)), eps)` के माध्यम से एक क्लैम्प लागू किया।
- यह सुधार एक असंगति को दूर करता है जिसका प्रभाव Qwen3-Next के लिए Hugging Face के transformers लाइब्रेरी पर भी था, जो कि पुल रिक्वेस्ट #40842 में ठीक किया गया था।
- अपडेट यह सुनिश्चित करता है कि संदर्भ इम्प्लीमेंटेशन में जहां एप्सिलॉन वर्गमूल गणना के भीतर शामिल होता है, वहां संगति बनी रहे।
यह सुधार यह सुनिश्चित करता है कि GDN परतों का उपयोग करने वाले मॉडल, जैसे कि flash-linear-attention पर आधारित वे, अपने संदर्भ इम्प्लीमेंटेशन के समान ही व्यवहार करते हैं।