O projeto llama.cpp lançou a compilação b10829, que corrige a implementação da normalização de consulta/chave da rede delta com portões (GDN). A alteração muda o método de normalização de `max` para `rsqrt`, alinhando-se com a definição usada pelo flash-linear-attention.

  • A normalização q/k do GDN agora usa `l2norm` conforme definido pelo flash-linear-attention: `x * rsqrt(sum(x*x) + eps)`.
  • Anteriormente, o llama.cpp usava `ggml_l2_norm`, que aplicava um clamp via `max(sqrt(sum(x*x)), eps)` em vez de colocar epsilon dentro da raiz.
  • Esta correção aborda uma inconsistência que também afetou a biblioteca transformers do Hugging Face para Qwen3-Next antes de ser corrigida no pull request #40842.
  • A atualização garante consistência com as implementações de referência, onde o epsilon é incluído dentro do cálculo da raiz quadrada.

Esta correção garante que os modelos que usam camadas GDN, como aqueles baseados em flash-linear-attention, se comportem de forma idêntica às suas implementações de referência.