llama.cpp परियोजना ने होस्ट/ड्राइवर ओवरहेड को कम करने के लिए RMS_NORM और SCALE ऑपरेशनों को एक ही CUDA कर्नेल में एकीकृत कर दिया है। पहले, अलग-अलग SCALE नोड्स अतिरिक्त कर्नेल लॉन्च जोड़ते थे जो साधारण बैच प्रसंस्करण में नगण्य थे लेकिन ड्राफ्ट-MTP अनुमानित कोडिंग के दौरान विलंबता को काफी बढ़ा देते थे।

  • एकीकरण rms_norm_f32 में एक do_scale फ्लैग जोड़ता है, जिससे एकीकृत पथ कर्नेल, रिडक्शन और लॉन्चर को साझा कर सकता है जबकि बिट-फॉर-बिट संख्यात्मक समानता बनाए रखता है।
  • Qwen3.8-27B के साथ 2x GTX 1080 Ti सेटअप पर, ड्राफ्ट-MTP स्थितियों के तहत 8000 टोकन के लिए 4.2% और 20000 टोकन के लिए 4.8% की सुधार के साथ कोल्ड प्रीफिल थ्रूपुट में वृद्धि हुई।
  • ubatch प्रति लॉन्च गिनती 1032.9 + 841.7 से घटकर 978.9 + 799.7 हो गई, जो GPU ऑपरेशन योग को बदले बिना पिछले बेलाइन गणनाओं के बराबर है।
  • RMS_NORM_SCALE, NORM_SCALE और संबंधित ऑपरेशनों के लिए सभी बैकएंड टेस्ट दोनों GPUs पर पास होते हैं, और प्लेक्सलिटी अफ्यूज्ड बिल्ड के समान ही रहती है।

यह अनुकूलन कर्नेल लॉन्च के संचयी खर्च को कम करके विशेष रूप से अनुमानित कोडिंग परिदृश्यों में इनफरेंस गति में सुधार करता है।