llama.cpp b10255 रिलीज़ ने एक-कंप्यूटेशनल डेटा न्यूमेरिक (oneDNN) SDPA पथ को गैर-FP16 कुंजी-मान्यता (KV) कैशे का समर्थन करने के लिए विस्तारित किया, जिसमें Q4_0–Q8_0 क्वांटाइज्ड फॉर्मेट और FP32 शामिल हैं। इस अपडेट से फ्यूज्ड सिस्टोलिक कोरल को नेटिव FP16 पथ की तरह ही चलने में सक्षम बनाया गया है, जिसमें प्रोसेसिंग से पहले K/V टेंसर को डेक्वांटाइज़ या घनत्वपूर्ण FP16 में रूपांतरित किया जाता है।
- समर्थित KV प्रकारों में Q4_0, Q4_1, Q5_0, Q5_1, Q8_0 और F32 शामिल हैं, जबकि BF16 और IQ प्रकारों को कनवर्जन केरल की अनुपस्थिति के कारण छोड़ दिया गया है।
- गैर-FP16 समर्थन प्रीफिल चरण में K >= 1024 और Q >= 32 की आवश्यकताओं पर निर्भर करता है।
- इस रिलीज़ में एक स्ट्रीम सिंक फिक्स शामिल है जो अनिवार्य रूप से wait_and_throw व्यवहार सुनिश्चित करता है और V_is_K_view एलियासिंग को हटाकर यह सुनिश्चित करता है कि K और V हमेशा अलग-अलग बफर में डेक्वांटाइज किए जाएं।
- macOS, Linux, Windows, Android और openEuler के लिए CPU, GPU (CUDA, Vulkan, ROCm, OpenCL) और SYCL और OpenVINO जैसे विशेष बैकएंड्स के लिए बाइनरी प्रदान की गई हैं।