हेक्सागॉन बैकएंड फ्लैश एटेंशन को रो-स्प्लिट मल्टीकोर एक्जीक्यूशन के लिए हेड-पैरेलल पार्टीशनिंग का उपयोग करने के लिए अपडेट करता है, जिसमें एक पिछली सीमा को दूर किया गया जहां कोर पूरा KV कैश पढ़ते थे। जब कोर काउंट से विभाज्य हो तो KV हेड्स द्वारा पार्टीशन करके, प्रत्येक कोर केवल अपने विशिष्ट शार्ड को KV कैश से पढ़ता है, जिससे मेमोरी बैंडविड्थ लाभ पुनर्स्थापित होते हैं।

  • 4c रो-स्प्लिट पर Qwen3-0.6B इनफरेंस स्पीड 6977 से बढ़कर 11026 टोकन/सेकंड (+58%) हो जाती है।
  • llama-3.2-3B प्रदर्शन 3717 से बढ़कर 5522 टोकन/सेकंड (+49%) हो जाता है।
  • Qwen3.5-4B में एक मामूली 4% लाभ मिलता है, जबकि MoE FFN के प्रभुत्व के कारण Gemma-4 MoE में कोई बदलाव नहीं दिखा।
  • इस फीचर को GGML_HEXAGON_FA_HEAD_SPLIT द्वारा नियंत्रित किया जाता है और हेड काउंट कोर काउंट से विभाज्य न होने पर यह टोकन-ब्लॉक स्प्लिटिंग पर वापस आ जाता है।

यह अनुकूलन हेक्सागॉन हार्डवेयर पर विशिष्ट मॉडल कॉन्फ़िगरेशन के लिए प्रीफिल थ्रूपुट को काफी तेज करता है।