llama.cpp प्रोजेक्ट ने संस्करण b10247 जारी किया, जो मल्टी-बैकएंड सेटअप पर बड़े मिक्चर ऑफ एक्सपर्ट्स (MoE) मॉडलों को लोड करते समय स्थिरता समस्याओं को दूर करता है। अपडेट में बैकएंड शेड्यूलर में फिक्स्ड-साइज ऐरे को ग्राफ स्प्लिट्स को 30 इनपुट टेंसर से अधिक हैंडल करने के लिए डायनामिकली आवंटित बफर्स से बदला गया है।

  • स्प्लिट ग्राफ इनपुट्स के लिए GGML_SCHED_MAX_SPLIT_INPUTS को डायनामिक आवंटन से बदला गया।
  • Gemma 4, Qwen MoE, Mixtral और DeepSeek जैसे चौड़े MoE मॉडलों को लोड करते समय क्रैश ठीक किए गए।
  • ग्राफ_साइज की गणना को एक फिक्स्ड कॉन्स्टेंट के बजाय वास्तविक इनपुट काउंट का उपयोग करने के लिए अपडेट किया गया।
  • macOS (Apple Silicon/Intel), Linux (CPU/Vulkan/ROCm/OpenVINO/SYCL), Windows (CPU/CUDA/Vulkan/OpenVINO/SYCL/HIP), Android और iOS के लिए बाइनरी प्रदान किए गए।

इस बदलाव से उपयोगकर्ताओं को मल्टीपल बैकएंड डिवाइसेज वाले सिस्टम पर शेड्यूलर-संबंधी क्रैश के बिना जटिल MoE आर्किटेक्चर चलाने की अनुमति मिलती है।