llama.cpp परियोजना ने GLM_DSA (GLM-5.2) मॉडल आर्किटेक्चर के लिए NextN/MTP अनुमानित डिकोडिंग समर्थन पेश करते हुए बिल्ड b10174 जारी किया।

  • GLM-5.2 NextN/MTP को --spec-type draft-mtp लक्ष्य के रूप में जोड़ता है, जिससे घना MLA ध्यान और MTP संदर्भ KV सेटअप सक्षम होता है।
  • GlmMoeDsaForCausalLM के लिए --mtp/--no-mtp निर्यात का समर्थन करने के लिए रूपांतरण स्क्रिप्ट को अपडेट करता है, जिससे उपयोगकर्ता निर्यात के दौरान NextN ब्लॉक को छोड़ या रख सकते हैं।
  • macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, SYCL) और openEuler प्लेटफ़ॉर्म के लिए पूर्व-निर्मित बाइनरी प्रदान करता है।

यह अपडेट llama.cpp फ्रेमवर्क के भीतर अनुमानित डिकोडिंग तकनीकों का लाभ उठाकर GLM-5.2 मॉडलों के लिए तेज़ इनफरेंस गति सक्षम बनाता है।