Proyek llama.cpp merilis build b10829, yang memperbaiki implementasi normalisasi query/kunci pada jaringan delta tergerbang (GDN). Perubahan ini menggeser metode normalisasi dari penggunaan `max` ke `rsqrt`, selaras dengan definisi yang digunakan oleh flash-linear-attention.
- Normalisasi q/k GDN kini menggunakan `l2norm` sesuai definisi flash-linear-attention: `x * rsqrt(sum(x*x) + eps)`.
- Sebelumnya, llama.cpp menggunakan `ggml_l2_norm`, yang menerapkan pembatasan melalui `max(sqrt(sum(x*x)), eps)` alih-alih menempatkan epsilon di dalam akar.
- Perbaikan ini mengatasi ketidaksesuaian yang juga memengaruhi pustaka transformers dari Hugging Face untuk Qwen3-Next sebelum dikoreksi dalam permintaan tarikan (pull request) #40842.
Pembaruan ini memastikan konsistensi dengan implementasi referensi di mana epsilon disertakan dalam perhitungan akar kuadrat.
Koreksi ini memastikan bahwa model yang menggunakan lapisan GDN, seperti yang berbasis pada flash-linear-attention, berperilaku identik dengan implementasi referensinya.