أصدر مشروع llama.cpp الإصدار 0.4.1، مقدّماً دعمًا لهيكلية Mixture of Experts الثلاثية (ternary) الخاصة بـ Maple 20B-A1B على وحدة المعالجة المركزية (CPU)، بالإضافة إلى دعم تجريبي لنماذج Tencent Hy 4 و Spark2.5.

  • إضافة دعم لهيكلية MoE الثلاثية لـ Maple 20B-A1B (على CPU).
  • إضافة دعم تجريبي لهيكلية Tencent Hy 4 (hy_v4).
  • إضافة دعم لنموذج Spark2.5.
  • تحديث ggml إلى الإصدار v0.24.0، مما وسّع تغطية الخلفية وقوّتها من خلال واجهة برمجة جديدة للتحكم في الدقة.
  • تحسين التعامل مع مخطط JSON عن طريق إعادة هيكلة تمثيله الداخلي باستخدام common_schema.
  • تقسيم محللات المحادثة المتخصصة إلى common/parsers وإضافة تسجيل بنية JSONL عبر --log-jsonl.
  • إصلاح تخصيص ذاكرة التخزين المؤقت (KV cache) لسياق MTP الخاص بنماذج DeepSeek2 و GLM-MoE والنماذج ذات الصلة.
  • إصلاح تطبيع GDN من max إلى rsqrt للنماذج المتأثرة من Qwen/Kimi/GLM.

يتيح هذا الإصدار تشغيل هياكل نماذج جديدة ويحسّن الاستقرار من خلال تصحيح التطبيع، وتخصيص ذاكرة التخزين المؤقت، وإدارة العمليات الفرعية للخادم.