llama.cpp प्रोजेक्ट ने b10988 बिल्ड जारी किया, जिसने विशेष रूप से मिक्स्चर ऑफ एक्सपर्ट्स (MoE) मॉडल्स के लिए ओपनसीएल बैकएंड में बदलाव किए हैं। अपडेट ने अनुमानित डिकोडिंग और बहु-टोकन भविष्यवाणी के दौरान बैच साइज के आधार पर MoE एक्सपर्ट मैट्रिक्स गुणा चुनने की तर्कसंगतता लागू की है।
- राउटिंग गिनती पर पूर्व-निर्मित q4_0 MoE GEMM संचालन को नियंत्रित करें।
- दक्षता बढ़ाने के लिए पैडेड MoE सक्रियण स्लॉट्स में शून्य लिखना बंद करें।
- CPU, CUDA, ROCm, Vulkan, OpenVINO, SYCL और Adreno प्लेटफार्मों के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी प्रदान करें।