أضاف مشروع llama.cpp الدعم لنموذج النصوص Kimi-K3، بتنفيذ بنية الانتباه الهجينة الخاصة به (KDA الخطي + MLA الكامل) إلى جانب خمسة ميزات معمارية محددة غير موجودة في النسخة الأقدم Kimi-Linear-48B.
- تتضمن التنفيذ انتباهاً متبقياً عبر الطبقات، وMoE كامنة، وتنشيط وضعيف محللاً لـ SwiGLU، وبوابة إخراج MLA، وبوابة KDA كاملة الرتبة.
- تُقدَّم الخبراء الموجهة باستخدام صيغة "mxfp4-pack-quantized" للضغط، وهي متوافقة بتياً مع MXFP4 الخاص بـ ggml مما يسمح بإعادة التعبئة بدون فقدان دون فك التكميم.
- يتعامل قالب المحادثة الجديد مع تنسيق Kimi-K3 المشابه لـ XTML والمميز بالوسوم للاستدلال، والمحتوى، واستدعاءات الأدوات، بما في ذلك فواصل الرسائل المحددة وتقسيم النطاق على مستوى الرموز.
- يصلح المصحح أخطاء الأنواع ويزيد LLAMA_MAX_EXPERTS من 512 إلى 1024، بينما يقوم الآن مُوفِّر النموذج بإصدار معلمة kda_gate_lower_bound بشكل صحيح للحفاظ على دقة الدورة الكاملة.
يتيح هذا التحديث للمستخدمين تشغيل Kimi-K3 محلياً مع صحة طرفية مثبتة مقابل التنفيذ المرجعي من Moonshot وبيانات التوليد الفعلية.