تم تحديث الخلفية ggml-openvino لـ llama.cpp إلى الإصدار 2026.4.1، مما يقدم تحسينات في الأداء، ودعمًا موسعًا للمشغلات، وتحسينًا في تعداد الأجهزة.

  • دمج توجيه محو الأمية (MoE) وتطبيع GDN QK، مع تمكين دمج MoE على GPU بشكل افتراضي.
  • دعم الأوزان المدمجة للبوابة والصعود في نماذج مثل gemma-4، مما يحقق زيادة في معدل الإكمال المسبق من 66.16 إلى 1608.73 ت/ث على Arc B390.
  • إصلاح لمعالجة المحور رتبة-3 في التنفيذ ذو الحالة، مما يحل مشكلات توقف بناء الرسم البياني لنماذج MoE.
  • تنفيذ تعداد الأجهزة والإبلاغ عن الذاكرة المتوافق مع PRD، مما يضمن التمييز الدقيق بين GPU و IGPU.
  • إضافة خيار k-requant q4_asym64 ووضع cache_only لاستيراد النماذج المُجمَّعة مباشرةً من القرص.

تحسّن هذه التغييرات أداء الاستدلال لهندسات MoE وتوفر اكتشافًا وإعدادًا أكثر موثوقية للأجهزة لمستخدمي OpenVINO.