أصدر مشروع llama.cpp الإصدار 0.4.1، مقدّماً دعمًا لهيكلية Mixture of Experts الثلاثية (ternary) الخاصة بـ Maple 20B-A1B على وحدة المعالجة المركزية (CPU)، بالإضافة إلى دعم تجريبي لنماذج Tencent Hy 4 و Spark2.5.
- إضافة دعم لهيكلية MoE الثلاثية لـ Maple 20B-A1B (على CPU).
- إضافة دعم تجريبي لهيكلية Tencent Hy 4 (hy_v4).
- إضافة دعم لنموذج Spark2.5.
- تحديث ggml إلى الإصدار v0.24.0، مما وسّع تغطية الخلفية وقوّتها من خلال واجهة برمجة جديدة للتحكم في الدقة.
- تحسين التعامل مع مخطط JSON عن طريق إعادة هيكلة تمثيله الداخلي باستخدام common_schema.
- تقسيم محللات المحادثة المتخصصة إلى common/parsers وإضافة تسجيل بنية JSONL عبر --log-jsonl.
- إصلاح تخصيص ذاكرة التخزين المؤقت (KV cache) لسياق MTP الخاص بنماذج DeepSeek2 و GLM-MoE والنماذج ذات الصلة.
- إصلاح تطبيع GDN من max إلى rsqrt للنماذج المتأثرة من Qwen/Kimi/GLM.
يتيح هذا الإصدار تشغيل هياكل نماذج جديدة ويحسّن الاستقرار من خلال تصحيح التطبيع، وتخصيص ذاكرة التخزين المؤقت، وإدارة العمليات الفرعية للخادم.