llama.cpp b10338 रिलीज ने मॉडल सेवर में एक गंभीर बग को हल किया जिसके कारण शेयर्ड एक्सपर्ट मिक्चर-ऑफ-एक्सपर्ट्स (MoE) मॉडल सेव होने के बाद लोड करने में विफल रहते थे। यह समस्या सेवर द्वारा `n_ff_chexp` मान को `LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH` कुंजी पर गलत तरीके से लिखने के कारण हुई, जिससे सही टेंसर आकार की जानकारी नष्ट हो गई।
- इस ठीक में यह सुनिश्चित किया गया है कि दूसरा कॉल शेयर्ड फीड-फॉरवर्ड लंबाई को ओवरराइट करने के बजाय सही `LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH` कुंजी लिखता है।
- इसने शेयर्ड एक्सपर्ट्स वाले आर्किटेक्चर्स के लिए लोड विफलताओं को हल किया, जिसमें qwen2moe, qwen3-next, granite-moe, hunyuan-moe, ernie4.5, bailingmoe2 और nemotron-h शामिल हैं।
- इस रिलीज में macOS (Apple Silicon और Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) और openEuler के लिए बाइनरी शामिल हैं।
यह ठीक यह सुनिश्चित करता है कि शेयर्ड एक्सपर्ट्स वाले MoE मॉडल के सेव-और-लोड रंडट्रिप्स टेंसर आकार असंगतियों के बिना सफल होते हैं।