llama.cpp b10956 रिलीज़ ने TOP_K ऑपरेशन में बड़े k मानों को संभालने के लिए SYCL बैकएंड के लिए एक रेडिक्स सिलेक्ट एल्गोरिदम पेश किया, जो पहले k > 32 के लिए CPU पर वापस आ जाता था। यह बदलाव हिस्टोग्राम-आधारित पास का उपयोग करके शेयर्ड लोकल मेमोरी फुटप्रिंट को k से स्वतंत्र रखते हुए बड़े k के लिए GPU-रिडेडेंट प्रोसेसिंग की अनुमति देता है।
- नई कार्यान्वयन 2048 और उससे आगे के k मानों का समर्थन करता है, जिससे qwen4exp जैसे स्पार्स-एटेंशन इंडेक्सर जैसी ऑपरेशंस के लिए बैकएंड राउंड-ट्रिप्स समाप्त हो जाते हैं।
- प्रदर्शन में सुधार में ne=[131072,1] पर k=2048 के साथ 4.98x गति वृद्धि और विशिष्ट बैच कॉन्फ़िगरेशन में CPU फॉलबैक की तुलना में 118x तक तेज़ निष्पादन शामिल है।
- Qwen3.8-Flash-Next के साथ 3x Arc Pro B60 पर एंड-टू-एंड परीक्षण ने d=131072 पर थ्रूपुट को 5.91 से 6.05 t/s तक बढ़ाया, जबकि प्लेक्सिटी अपरिवर्तित रही।
- इस रिलीज़ में CPU, CUDA, ROCm, Vulkan, OpenVINO और SYCL बैकएंड्स के लिए macOS, Linux, Windows, Android और openEuler के लिए बाइनरी शामिल हैं।
यह अपडेट SYCL डिवाइसों पर कुशलतापूर्वक बड़े-k top_k ऑपरेशंस को सक्षम बनाता है, जिससे टोकन चयन के लिए उच्च k मानों की आवश्यकता वाले मॉडल्स में प्रदर्शन बाधाओं से बचा जाता है।