llama.cpp प्रोजेक्ट ने संस्करण b10635 जारी किया, जिसमें CUDA सहायता के लिए विशिष्ट अपडेट शामिल हैं। मुख्य बदलाव 6.0 (sm_60) गणना क्षमता वाले GPU पर Mixture of Experts (MoE) आर्किटेक्चर के लिए मिक्स्ड-प्रिसीजन मैट्रिक्स गुणा (mmq) को अनब्लॉक करना है।

  • CUDA: sm_60 पर MoE के लिए mmq अनब्लॉक किया गया।
  • CUDA: dp4a और पुरानी आर्किटेक्चर के लिए mmq-config-pascal डुप्लिकेट किया गया।
  • CUDA: Q2_K, Q4_K, Q5_K, और Q6_K क्वांटीकरण फॉर्मेट्स के लिए गैर-dp4a Pascal GPU पर ओक्यूपेंसी कम की गई।

इस रिलीज में macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm), Android, और openEuler के लिए बाइनरी प्रदान की गई हैं।