llama.cpp प्रोजेक्ट ने संस्करण b10669 जारी किया, जिसमें एक जगह f16 KV कैश को बाइंड करके oneDNN SDPA पथ के लिए प्रदर्शन अनुकूलन शामिल है।

  • इस बदलाव से प्रीफिल चंक के दौरान मेमोरी ट्रैफिक कम होता है; उदाहरण के लिए, Qwen3.8 27B पर 34816 की लाइव KV लंबाई के साथ, यह स्टेज्ड कॉपीज़ से बचकर ubatch प्रति ट्रैफिक को 4.56 GB से कम कर देता है।
  • बाइनरी macOS (Apple Silicon और Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, OpenCL, Vulkan, OpenVINO, SYCL, ROCm) और openEuler के लिए उपलब्ध हैं।

यह अपडेट उपयोगकर्ताओं को समर्थित हार्डवेयर पर अनुकूलित इनफरेंस प्रदर्शन प्रदान करता है जबकि व्यापक प्लेटफ़ॉर्म संगतता बनाए रखता है।