قام مشروع llama.cpp بدمج عمليتي RMS_NORM وSCALE في نواة CUDA واحدة لتقليل الحمل على المضيف/المحرك. سابقاً، كانت العقد المنفصلة لـ SCALE تضيف إطلاقات إضافية للنواة كانت ضئيلة في المعالجة الدفعية العادية، لكنها زادت بشكل ملحوظ من زمن الاستجابة أثناء فك التشفير التخميني بالمسودة (draft-mtp).
- يضيف الدمج علم do_scale إلى rms_norm_f32، مما يسمح للمسار المدمج بمشاركة النواة، والاختزال، والمطلق مع الحفاظ على التكافؤ العددي حرفياً بحرف.
- على إعداد ببطاقتي GTX 1080 Ti مع Qwen3.8-27B، تحسنت سرعة الحشو البارد بنسبة 4.2% لـ 8000 رمز و4.8% لـ 20000 رمز تحت ظروف draft-mtp.
- انخفض عدد الإطلاقات لكل ubatch من 1032.9 + 841.7 إلى 978.9 + 799.7، متطابقاً مع أعداد الأساس السابقة دون تغيير مجموع عمليات وحدة معالجة الرسومات.
- اجتازت جميع اختبارات الخلفية لـ RMS_NORM_SCALE وNORM_SCALE والعمليات ذات الصلة على كلتا بطاقتي الرسومات، مع بقاء التشتت المتوقع (perplexity) مطابقاً للنسخة غير المدمجة.
يحسن هذا التحسين سرعة الاستدلال بشكل خاص في سيناريوهات فك التشفير التخميني من خلال تقليل التكلفة التراكمية لإطلاقات النواة.