llama.cpp b10208 रिलीज ने oneMKL GEMM फ्लैश एटेंशन के लिए SYCL समर्थन पेश किया है, जिससे प्रॉम्प्ट प्रोसेसिंग के लिए XMX हार्डवेयर त्वरण सक्षम होता है। इस बदलाव से डिफ़ॉल्ट TILE पाथ की जगह MKL kernels का उपयोग करके Intel Arc GPUs पर इनफरेंस गति में महत्वपूर्ण सुधार हुआ है।

  • प्रदर्शन बेंचमार्क B70/Battlemage हार्डवेयर पर Gemma-4-26B (1473 t/s बनाम 746 t/s) के लिए 1.97x गति वृद्धि और Qwen3.6-27B (609 t/s बनाम 330 t/s) के लिए 1.85x गति वृद्धि दिखाते हैं।
  • इस कार्यान्वयन ने normalize kernel में पहले मौजूद interleaved destination layout बग को ठीक किया था, जो अधिकांश मॉडल्स के लिए एटेंशन आउटपुट को खराब कर देता था।
  • MKL फ्लैश एटेंशन अब सभी KV कैश प्रकारों (F16, BF16, F32, और क्वांटाइज्ड) के लिए सक्षम है, जिससे पहले केवल क्वांटाइज्ड कैश तक सीमित रखी गई प्रतिबंधात्मकता हट गई है।
  • नए पर्यावरण चर उपयोगकर्ताओं को GGML_SYCL_ENABLE_MKL_FA के माध्यम से डीबगिंग सक्षम करने, फीचर अक्षम करने या सक्रियण थ्रेशोल्ड को नियंत्रित करने की अनुमति देते हैं।

यह अपडेट संगत Intel हार्डवेयर पर मल्टी-टोकन प्रीफिल ऑपरेशन के लिए महत्वपूर्ण लेटेंसी कमी प्रदान करता है, जबकि मान्य कार्यान्वयनों के साथ perplexity समानता बनाए रखता है।