llama.cpp परियोजना ने HrmTextForCausalLM आर्किटेक्चर के लिए समर्थन जोड़ा है, विशेष रूप से DFM Mimir 1B मॉडल के लिए इनफरेंस को सक्षम बनाया है। इस कार्यान्वयन में मॉडल की अद्वितीय संरचना को संभालने के लिए एक नया GGUF राइटर और लोडर पेश किया गया है, जो समान टोकन स्ट्रीम पर दो ट्रान्सफॉर्मर स्टैक्स को वैकल्पिक चक्र में चलाता है।
- रूपांतरण प्रक्रिया फ्यूज्ड gqkv प्रक्षेपनों को llama.cpp q/k/v और एक अलग सिग्मोइड गेटिंग टेंसर में मैप करती है।
- KV कैश लूपेड आर्किटेक्चर्स के लिए ब्लॉक एलियासिंग संभालता है, 128 परतों में प्रत्येक पारगमन के लिए एक प्रविष्टि रखता है।
- इनफरेंस की जांच Hugging Face रेफरेंस आउटपुट के साथ समान argmax परिणामों को 334 स्थानों पर बनाए रखते हुए की गई है।
- q8_0 में क्वांटीकरण शीर्ष-1 सटीकता का 95.8% बनाए रखता है, और शेष त्रुटियाँ HF शीर्ष-5 के भीतर सीमित हैं।
यह जोड़ उपयोगकर्ताओं को स्थानीय हार्डवेयर पर HRM-text मॉडल चलाने की अनुमति देता है, हालांकि आर्किटेक्चर के डिज़ाइन के कारण इसके साथ महत्वपूर्ण प्रदर्शन समझौते भी हैं।