Le projet llama.cpp a publié la version b10829, qui corrige l'implémentation de la normalisation des requêtes/clés du réseau delta à portes (GDN). Le changement remplace la méthode de normalisation utilisant `max` par `rsqrt`, s'alignant ainsi sur la définition utilisée par flash-linear-attention.

  • La normalisation q/k de GDN utilise désormais `l2norm` tel que défini par flash-linear-attention : `x * rsqrt(sum(x*x) + eps)`.
  • Auparavant, llama.cpp utilisait `ggml_l2_norm`, qui appliquait un clamp via `max(sqrt(sum(x*x)), eps)` au lieu de placer epsilon à l'intérieur de la racine.
  • Cette correction adresse un désalignement qui affectait également la bibliothèque transformers de Hugging Face pour Qwen3-Next avant d'être corrigé dans la demande de tirage #40842.
  • La mise à jour assure la cohérence avec les implémentations de référence où epsilon est inclus dans le calcul de la racine carrée.

Cette correction garantit que les modèles utilisant des couches GDN, tels que ceux basés sur flash-linear-attention, se comportent identiquement à leurs implémentations de référence.