أصدر مشروع llama.cpp الإصدار b10645، مقدمًا خيار سطر الأوامر الجديد --n-cpu-ffn. تتيح هذه الميزة للمستخدمين تحديد عدد الطبقات التي يتم إفراغ أوزان الشبكة العصبية المباشرة (FFN) الكثيفة منها إلى وحدة المعالجة المركزية.
- يضيف --n-cpu-ffn للتحكم في إفراغ أوزان FFN الكثيفة إلى وحدة المعالجة المركزية لأول N طبقات.
- يزيل التكرار في حلقات التجاوز لخيارات --n-cpu-moe و --spec-draft-n-cpu-moe.
- يعمم llm_ffn_block_regex عبر نمط التعبير المنتظم لـ FFN.
يوفر الإصدار ملفات ثنائية لأنظمة macOS و Linux و Windows و Android و openEuler عبر خلفيات وحدة المعالجة المركزية، ووحدة معالجة الرسومات (CUDA, Vulkan, ROCm, OpenCL)، ومسرعات الذكاء الاصطناعي.