llama.cpp प्रोजेक्ट ने GLM-5.3-Flash (GLM5-Next) मॉडल आर्किटेक्चर के लिए प्रारंभिक समर्थन जोड़ा है, जिसमें हाइब्रिड-इंडेक्स मेमोरी में माइग्रेशन और शुरुआती मल्टी-टोकन प्रेडिक्शन (MTP) क्षमताएं शामिल हैं।
- प्रारंभिक MTP समर्थन जोड़ा गया था, हालांकि केंद्रित समीक्षा की अनुमति देने के लिए इसे प्रारंभिक पुल रिक्वेस्ट से हटा दिया गया था।
- k-pool लेआउट अब ubatches के बीच बनाए रखा जाता है ताकि सीक्वेंस एडिट और शेयर्ड टियरडाउन के बाद पुरानापन से बचा जा सके।
- कन्व स्टेट और डेल्टा नेट स्टेट के लिए रिकरेंट रोलबैक चेकपॉइंट सही तरीके से लिखे जाते हैं।
- गैर-संतत क्वेरीज के लिए build_attn_mha स्ट्रीम स्टाइड में एक बग को ठीक किया गया, जिससे GLM5-Next के लिए सही मल्टी-स्ट्रीम प्रीफिल सुनिश्चित हुआ।
- क्वांटीज़ेशन प्रोटेक्शन फिल्टर्स को डुप्लिकेट एंट्रीज हटाने के लिए साफ किया गया।
ये बदलाव CUDA, ROCm और CPU सहित विभिन्न हार्डवेयर बैकएंड्स पर GLM5-Next मॉडल्स के लिए स्थिर इनफरेंस और सही स्टेट मैनेजमेंट सुनिश्चित करते हैं।