llama.cpp प्रोजेक्ट ने बिल्ड b10645 जारी किया, जिसमें नई कमांड-लाइन विकल्प --n-cpu-ffn पेश की गई है। इस सुविधा से उपयोगकर्ता उन परतों की संख्या निर्दिष्ट कर सकते हैं जिनके घने फीड-फॉरवर्ड नेटवर्क (FFN) वजन CPU पर ऑफलोड किए जाते हैं।
- पहले N परतों के लिए घने FFN वजन के CPU ऑफलोडिंग को नियंत्रित करने के लिए --n-cpu-ffn जोड़ता है।
- --n-cpu-moe और --spec-draft-n-cpu-moe विकल्पों के लिए ओवरराइड लूप को डुप्लिकेट हटाता है।
- FFN रेगेक्स पैटर्न पर llm_ffn_block_regex को सामान्य बनाता है।
रिलीज में CPU, GPU (CUDA, Vulkan, ROCm, OpenCL), और AI एक्सेलेरेटर बैकएंड के लिए macOS, Linux, Windows, Android, और openEuler के लिए बाइनरी प्रदान की गई हैं।