El proyecto llama.cpp lanzó la compilación b10829, que corrige la implementación de la normalización de consulta/clave de la red delta enmascarada (GDN). El cambio cambia el método de normalización de usar `max` a `rsqrt`, alineándose con la definición utilizada por flash-linear-attention.

  • La normalización q/k de GDN ahora usa `l2norm` según lo definido por flash-linear-attention: `x * rsqrt(sum(x*x) + eps)`.
  • Anteriormente, llama.cpp usaba `ggml_l2_norm`, que aplicaba un recorte mediante `max(sqrt(sum(x*x)), eps)` en lugar de colocar epsilon dentro de la raíz.
  • Esta corrección aborda una desalineación que también afectó a la biblioteca transformers de Hugging Face para Qwen3-Next antes de ser corregida en el pull request #40842.
  • La actualización asegura la consistencia con las implementaciones de referencia donde epsilon se incluye dentro del cálculo de la raíz cuadrada.

Esta corrección garantiza que los modelos que utilizan capas GDN, como aquellos basados en flash-linear-attention, se comporten idénticamente a sus implementaciones de referencia.