Проект llama.cpp выпустил сборку b10829, которая исправляет реализацию нормализации запросов/ключей (query/key) в gated delta net (GDN). Изменение переключает метод нормализации с использования `max` на `rsqrt`, согласуясь с определением, используемым во flash-linear-attention.
- Нормализация q/k GDN теперь использует `l2norm` согласно определению flash-linear-attention: `x * rsqrt(sum(x*x) + eps)`.
- Ранее llama.cpp использовала `ggml_l2_norm`, которая применяла ограничение через `max(sqrt(sum(x*x)), eps)` вместо помещения epsilon внутри корня.
- Это исправление устраняет несоответствие, которое также затрагивало библиотеку transformers от Hugging Face для Qwen3-Next до её исправления в pull request #40842.
- Обновление обеспечивает согласованность с эталонными реализациями, где epsilon включено в вычисление квадратного корня.
Это исправление гарантирует, что модели, использующие слои GDN, такие как основанные на flash-linear-attention, ведут себя идентично своим эталонным реализациям.