llama.cpp प्रोजेक्ट ने बिल्ड b11039 जारी किया, जिसने सभी SWA का उपयोग करने वाले मॉडलों के लिए स्लाइविंग विंडो एटेंशन (SWA) पैटर्न और MLA SWA ज्यामिति लिखने हेतु मॉडल-सेवर को अपडेट किया। इस बदलाव ने सुनिश्चित किया कि `sliding_window_pattern` एक स्केलर में संक्षिप्त करने के बजाय पर-लेयर फ्लैग के रूप में लिखा जाए, जिससे सटीक डेटा प्रतिनिधित्व बना रहता है।

  • लोडर्स अब `llama_model_base::load_swa_pattern()` के माध्यम से SWA पैटर्न को एक अवधि या पर-लेयर सरणी के रूप में पढ़ते हैं, जिसने olmo2, gemma3n, और exaone4 के लिए कन्वर्टर्स में सरणियों की मौन उपेक्षा को ठीक किया।
  • मॉडल-सेवर SWA परतों के लिए MLA कुंजी/मूल्य लंबाई और KV LoRA रैंक लिखता है, जो dots3note द्वारा आवश्यक है।
  • यह plamo3, gemma3, cohere2, cohere2moe, olmo2, exone-moe, afmoe, mimo2, spark2_5, muse-glimmer, mellum, laguna, granite_swa, dots3note, और maple के लिए सेवर को सक्षम बनाता है।
  • सूचीबद्ध सभी मॉडल test-llama-archs के बिट-सटीक रूट्रिप में सफल होते हैं।

अपडेट यह सुनिश्चित करता है कि llama.cpp द्वारा उत्पन्न GGUF फ़ाइलें इच्छित SWA कॉन्फ़िगरेशन से मेल खाती हैं, बिना उन मौजूदा प्रकाशित फ़ाइलों के आउटपुट को बदले जो डिफ़ॉल्ट अवधि पर निर्भर थीं।