أصدر مشروع llama.cpp البناء b11039، الذي يحدث الحافظة لكتابة أنماط الانتباه ذات النافذة المنزلقة (SWA) وهندسة MLA SWA لجميع النماذج التي تستخدم SWA. يضمن التغيير كتابة `sliding_window_pattern` كعلم لكل طبقة بدلاً من تجميعها إلى قيمة قياسية، مما يحافظ على تمثيل البيانات بدقة.
- الآن تقرأ الحوامل نمط SWA إما كدورة أو كمصفوفة لكل طبقة عبر `llama_model_base::load_swa_pattern()`، مما يصلح التجاهلات الصامتة للمصفوفات في المحولات لـ olmo2 و gemma3n و exaone4.
- تكتب الحافظة أطوال مفاتيح/قيم MLA وترتيب KV LoRA لطبقات SWA، وهو مطلوب بواسطة dots3note.
- هذا يمكّن الحافظة لـ plamo3 و gemma3 و cohere2 و cohere2moe و olmo2 و exone-moe و afmoe و mimo2 و spark2_5 و muse-glimmer و mellum و laguna و granite_swa و dots3note و maple.
- تمر جميع النماذج المذكورة في اختبار roundtrip الدقيق للبت لـ test-llama-archs.
يضمن التحديث مطابقة ملفات GGUF المولدة بواسطة llama.cpp لتكوينات SWA المقصودة دون تغيير المخرجات لملفات النشر الحالية التي اعتمدت على دورات افتراضية.