llama.cpp 프로젝트는 게이트드 델타 넷(GDN) 쿼리/키 정규화 구현을 수정한 빌드 b10829를 출시했습니다. 이 변경은 정규화 방법을 `max`에서 `rsqrt`로 전환하여 flash-linear-attention에서 사용하는 정의와 일치시킵니다.
- GDN q/k 정규화는 이제 flash-linear-attention이 정의한 대로 `l2norm`을 사용합니다: `x * rsqrt(sum(x*x) + eps)`.
- 이전에는 llama.cpp가 `ggml_l2_norm`을 사용했으며, 이는 제곱근 안에 이타를 포함하는 대신 `max(sqrt(sum(x*x)), eps)`를 통해 클램프를 적용했습니다.
- 이 수정은 pull request #40842에서 수정되기 전 Qwen3-Next에 대한 Hugging Face의 transformers 라이브러리에도 영향을 미쳤던 불일치를 해결합니다.
- 이 업데이트는 이타가 제곱근 계산 내에 포함되는 참조 구현과의 일관성을 보장합니다.
이 수정은 flash-linear-attention 기반과 같은 GDN 레이어를 사용하는 모델이 참조 구현과 동일하게 동작하도록 보장합니다.