llama.cpp प्रोजेक्ट ने संस्करण b11390 जारी किया है, जिसमें एक CUDA MMQ मेमोरी फॉल्ट के लिए समाधान शामिल है जो तब होता था जब विशेषज्ञों की संख्या माइक्रो-बैच साइज़ से काफी बड़ी होती थी।
- Mixture-of-Experts (MMQ) हैंडलिंग से संबंधित CUDA बैकएंड में मेमोरी फॉल्ट को हल करता है।
- macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL, Snapdragon), Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, और openEuler के लिए बाइनरी प्रदान करता है।
- एक अद्यतन UI बिल्ड शामिल है।
यह अपडेट CUDA हार्डवेयर पर Mixture-of-Experts मॉडल चलाते समय विशिष्ट मेमोरी एक्सेस त्रुटि को रोककर उपयोगकर्ताओं के लिए स्थिरता सुनिश्चित करता है।