llama.cpp परियोजना ने अपने Metal बैकएंड के ऑपरेशन फ्यूजन पैटर्न को एक ही टेबल में एकीकृत कर दिया है, जो ग्राफ ऑप्टिमाइज़र और ऑप एन्कोडर्स दोनों द्वारा साझा किया जाता है। इस बदलाव ने टोकन जनन गति में लगभग 5% पश्चगमन का कारण बन रहे निरंतर आउटपुट इंडेक्स में एक बग को भी ठीक किया।

  • सभी फ्यूज़ करने योग्य ऑप पैटर्न अब ggml-metal-fuse.cpp में एक बार घोषित किए गए हैं, जिससे ऑप्टिमाइज़ेशन और कंप्यूट चरणों के बीच स्थिरता सुनिश्चित होती है।
  • निरंतर ग्राफ नोड इंडेक्स के लिए एक ठीक करने से फ्यूजन पैटर्न के अंतिम नोड का उपयोग-गणना जाँच के अधीन होने की त्रुटि को रोकता है, जिससे norm/MUL फ्यूजन पुनर्स्थापित होता है।
  • नया समर्थन gating_delta_net kernels को कैश कॉपी ऑपरेशंस के साथ फ्यूज़ करने की अनुमति देता है, जो KV कैश बफर में सीधे स्नैपशॉट लिखते हैं।
  • 'raw' फ्यूजन फ्लैग को पैटर्न-विशिष्ट कॉलबैक सुरक्षा सत्यापक के रूप में कार्य करने की स्पष्टता देने के लिए 'unsafe' में बदल दिया गया है।
  • एक नया ad-hoc API परीक्षण के लिए बैकएंड-अज्ञात फ्यूजन सांख्यिकी प्रदान करता है, जिसमें NMSE के माध्यम से फ्यूज़ और अफ्यूज़ लॉगिट्स की तुलना करने वाला पश्चगमन परीक्षण समूह शामिल है।

ये अपडेट फ्यूजन तर्क को एकीकृत करके कोड बनाए रखने योग्यता में सुधार करते हैं और पिछले संस्करणों में मौन फ्यूजन विफलताओं के कारण हुए प्रदर्शन हानि को पुनर्स्थापित करते हैं।