أضاف مشروع llama.cpp دعمًا لهيكلية HrmTextForCausalLM، مما يمكّن تحديد النماذج بشكل خاص لنموذج DFM Mimir 1B. تقدم هذه التنفيذة كاتب GGUF ومحمّلًا جديدًا للتعامل مع البنية الفريدة للنموذج، التي تشغّل مجموعتي محولات متبادلتين في دورة متناوبة عبر نفس تدفق الرموز.
- تترجم عملية التحويل الإسقاطات المدمجة gqkv إلى q/k/v من llama.cpp بالإضافة إلى موتر بوابة sigmoid منفصل.
- يتعامل مخزن KV مع الالتباس الكتلي للبنى المتكررة، حيث يحتفظ بمدخل واحد لكل مرور عبر 128 طبقة.
- تم التحقق من صحة الاستدلال مقابل المخرجات المرجعية لـ Hugging Face بنتائج argmax متطابقة عبر 334 موضعًا.
- تحتفظ الكمية q8_0 بدقة top-1 بنسبة 95.8٪، مع حصر الأخطاء المتبقية ضمن top-5 من HF.
يتيح هذا الإضافة للمستخدمين تشغيل نماذج HRM-text على الأجهزة المحلية، رغم أنه يأتي بتنازلات أداء كبيرة بسبب تصميم البنية.