يعالج إصدار llama.cpp b10981 مشكلات صحة حرجة في مسار فك التشفير الشرعي للخلفية OpenVINO، ويصحح بشكل خاص دعم النماذج مثل Gemma-4 التي تستخدم أحجام رؤوس لكل طبقة. كما يقدم تحسينات لاستنتاج GPU Mixture of Experts (MoE) ويحسن الأداء من خلال إعادة ترتيب حالات KV.
- إصلاح إخفاقات فك التشفير الشرعي لـ Gemma-4 عن طريق التعامل الصحيح مع أعداد الرؤوس لكل نوع طبقة وطبحات النافذة المنزلقة.
- تحسين أداء فك التشفير الشرعي على GPU، حيث ارتفع gemma-4-12B من 6.27 إلى 9.11 t/s عند عمق 8192.
- إضافة دعم لـ GGML_OPENVINO_REQUANT_KQUANT لاختيار هدف إعادة الكمّية 4-bit وGGML_OPENVINO_SPILL_DIR لتصريف مخازن الأوزان إلى القرص.
- تحسين استنتاج GPU MoE عن طريق دمج كتلة الخبير في MOECompressed وإعادة كمّية خبراء مجمعة 8-bit.
- تمكين نماذج المشفر بدون ذاكرة تخزين مؤقت على NPU من خلال قبول مشاهدات RoPE المعبأة لـ QVK واكتشاف الانتباه بدون ذاكرة تخزين مؤقت من الأقنعة.
- إصلاح عمليات ADD/SWIGLU_CLAMP المختلطة الدقة عن طريق رفع أنواع المعاملات غير المتطابقة إلى f32 للحفاظ على الدقة.
تضمن هذه التغييرات استنتاجًا دقيقًا للهندسات المعمارية للنماذج المعقدة مثل Gemma-4، مع توفير تسريعات قابلة للقياس لفك التشفير الشرعي وأحمال عمل MoE على الأجهزة المتوافقة.