llama.cpp b10306 रिलीज ने SYCL बैकएंड के लिए प्रदर्शन अनुकूलन पेश किए, विशेष रूप से गेटेड लीनियर यूनिट (GLU) ऑपरेशन को टारगेट करते हुए। अपडेट में फ्यूज़्ड GLU ऑप्स के लिए एक सतत तेज़ पथ जोड़ा गया है और पहले अलग-अलग कर्नेल को एक सामान्य लॉन्चर साझा करने के लिए संघीकृत किया गया है।

  • f16 और f32 में 512 और 2048 टोकन के साथ 17408 कॉलम कवर करते हुए SWIGLU प्रदर्शन टेस्ट केस जोड़े गए।
  • ऑपरेशन को एक तर्क के रूप में लेते हुए फ्यूज़्ड-GLU कर्नेल को संघीकृत किया गया, जिससे SYCL_GELU_BLOCK_SIZE और SYCL_SILU_BLOCK_SIZE जैसे उपयोग न किए जाने वाले स्थिरांक हटा दिए गए।
  • सतत ऑपरेंड्स के लिए एक फ्लैट कर्नेल डिस्पैच लागू किया गया है जहाँ डी-इंटरलीव इंडेक्स गणना पहचान में बदल जाती है।
  • Arc Pro B70 पर स्प्लिट GLU के लिए f16 में +14% प्रदर्शन सुधार और f32 में +4% सुधार हासिल किया गया, जबकि फ्यूज़्ड ऑपरेशन अपरिवर्तित रहे।

इन बदलावों ने विशिष्ट टेंसर कॉन्फ़िगरेशन के लिए मेमोरी एक्सेस पैटर्न को अनुकूलित करके और कोड डुप्लिकेशन कम करके SYCL बैकएंड की दक्षता में सुधार किया है।