llama.cpp प्रोजेक्ट ने संस्करण b10514 जारी किया है, जिसमें IBM's GraniteSWAForCausalLM और GraniteMoeSWAForCausalLM आर्किटेक्चर के लिए रूपांतरण इंफ्रास्ट्रक्चर पेश किया गया है। यह अपडेट उपयोगकर्ताओं को इन विशिष्ट मॉडल प्रकारों को llama.cpp के साथ उपयोग के लिए GGUF प्रारूप में बदलने की अनुमति देता है।

  • GraniteSWAForCausalLM और GraniteMoeSWAForCausalLM के लिए feat(convert) समर्थन जोड़ा गया।
  • rope_pattern सरणी और प्रति-परत rope निर्धारण के लिए रूपांतरण इंफ्रास्ट्रक्चर लागू किया गया।
  • non-rope परतों का समर्थन करने के लिए SWA पैटर्न तर्क ठीक किया गया और ffn gate inp के लिए नामकरण सुधारा गया।
  • has_rope स्थिरांक के साथ llama_hparams को अपडेट किया गया और hacky rope_finetuned fallbacks हटा दिए गए।
  • CPU, CUDA, Vulkan, OpenCL और अन्य backends के लिए macOS, Linux, Windows और Android के लिए बाइनरी शामिल किए गए।

यह रिलीज़ llama.cpp इकोसिस्टम को IBM's sliding window attention मॉडल का स्थानीय रूप से समर्थन करने की अनुमति देती है, जिससे स्थानीय इनफरेंस के लिए उपलब्ध संगत आर्किटेक्चर की श्रृंखला बढ़ जाती है।