أصدر مشروع llama.cpp الإصدار b10829، الذي يصحح تنفيذ تطبيع الاستعلام/المفتاح لشبكة دلتا المقننة (GDN). يغيّر هذا التطبيع طريقة التطبيع من استخدام `max` إلى `rsqrt`، بما يتماشى مع التعريف المستخدم في flash-linear-attention.
- يستخدم تطبيع q/k لـ GDN الآن `l2norm` كما عرّفته flash-linear-attention: `x * rsqrt(sum(x*x) + eps)`.
- سابقاً، استخدمت llama.cpp `ggml_l2_norm`، التي طبقت تقييداً عبر `max(sqrt(sum(x*x)), eps)` بدلاً من وضع قيمة إيبسيلون داخل الجذر.
- يعالج هذا الإصلاح عدم التطابق الذي أثر أيضاً على مكتبة transformers التابعة لـ Hugging Face لنماذج Qwen3-Next قبل تصحيحه في طلب السحب #40842.
- يضمن التحديث اتساقاً مع التطبيقات المرجعية حيث يتم تضمين إيبسيلون داخل حساب الجذر التربيعي.
يضمن هذا التصحيح أن النماذج التي تستخدم طبقات GDN، مثل تلك القائمة على flash-linear-attention، تتصرف بشكل مطابق لتطبيقاتها المرجعية.