llama.cpp परियोजना ने संस्करण 0.4.1 जारी किया, जिसमें CPU पर Maple 20B-A1B टर्नरी मिक्चर ऑफ एक्सपर्ट्स आर्किटेक्चर के लिए समर्थन और Tencent Hy 4 तथा Spark2.5 मॉडल्स के लिए प्रीव्यू समर्थन शामिल है।

  • Maple 20B-A1B टर्नरी MoE आर्किटेक्चर (CPU) समर्थन जोड़ा गया।
  • Tencent Hy 4 (hy_v4) प्रीव्यू आर्किटेक्चर समर्थन जोड़ा गया।
  • Spark2.5 मॉडल समर्थन जोड़ा गया।
  • ggml को v0.24.0 तक अपडेट किया गया, जिसमें नई प्रिसिजन-कंट्रोल API के साथ बैकएंड कवरेज और स्थिरता बढ़ी है।
  • common_schema आंतरिक प्रतिनिधित्व का उपयोग करके पुनर्लेखन के माध्यम से JSON स्कीमा हैंडलिंग में सुधार किया गया।
  • विशेष चैट पार्सर को common/parsers में विभाजित किया गया और --log-jsonl के माध्यम से संरचित JSONL लॉगिंग जोड़ी गई।
  • DeepSeek2, GLM-MoE और संबंधित मॉडल्स के लिए MTP कॉन्टेक्स्ट KV कैश आवंटन में सुधार किया गया।
  • प्रभावित Qwen/Kimi/GLM मॉडल्स के लिए GDN नॉर्मलाइजेशन को max से rsqrt तक ठीक किया गया।

यह रिलीज़ नए मॉडल आर्किटेक्चर चलाने की सुविधा प्रदान करती है और संशोधित नॉर्मलाइजेशन, कैश आवंटन और सर्वर चाइल्ड-प्रोसेस प्रबंधन के माध्यम से स्थिरता में सुधार लाती है।