أصدر مشروع llama.cpp الإصدار b11009، الذي يعالج مشكلات حرجة مع حالة التقسيم وحسابات الدقة لطبقات الانتباه QKV المدمجة.
- يحسب كود النموذج الآن حالات التقسيم لـ attn_qkv بشكل صحيح بناءً على n_head * n_embd_head_k، مما يحل مشكلات التوافق مع نماذج gemma4 التي تستخدم العلم --fuse-qkv حيث n_embd هو 5376 ولكن Q هو 8192.
- تمت إضافة دعم لطبقات الانتباه الكاملة المدمجة لهندسات qwen35 و qwen35moe.
- تمت إضافة علامة TODO [TAG_SPLIT_QGATE_QWEN] لتتبع العمل الإضافي على تقسيم QGate لنماذج Qwen.
يضمن هذا الإصدار أن التكوينات المحددة للنموذج، خاصة تلك التي تتضمن عمليات QMV المدمجة في gemma4 و qwen35، تعمل بشكل صحيح دون أخطاء حساب الحالة.