llama.cpp प्रोजेक्ट ने संस्करण b10707 जारी किया, जिसमें कुंजी-मान (KV) कैश हैंडलिंग के लिए एक प्रदर्शन अनुकूलन शामिल है। अपडेट `for_each_token_in` फ़ंक्शन को संशोधित करता है ताकि एक विशिष्ट सेल के भीतर सभी सीक्वेंस देखे जाने पर स्कैनिंग बंद हो जाए, न कि सभी संभावित अधिकतम सीक्वेंस पर पुनरावृत्ति की जाए।

  • यह परिवर्तन `get_prev_tokens` कॉलर के माध्यम से n-gram पथ को लक्षित करता है।
  • RTX PRO 6000 पर Qwen3.8-Flash-Next UD-Q4_K_XL के साथ, 55k संदर्भ पर जनरेशन गति 56.3 से बढ़कर 74.3 टोकन प्रति सेकंड हो गई।
  • 132k संदर्भ पर, जनरेशन गति 33.6 से बढ़कर 50.9 टोकन प्रति सेकंड हो गई।
  • अनुकूलन उपयोग की गई कोशिकाओं की संख्या के साथ स्केल होता है, जिससे लंबे संदर्भों में लाभ अधिक स्पष्ट होते हैं जबकि प्रॉम्प्ट प्रसंस्करण अपरिवर्तित रहता है।

रिलीज में macOS (Apple Silicon और Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, ROCm), और openEuler के लिए बाइनरी प्रदान की गई हैं।