يحدّث الخلفيّة hexagon الانتباه السريع (flash attention) لاستخدام التقسيم المتوازي للرؤوس للتنفيذ متعدد النوى مع تقسيم الصفوف، مما يعالج قيوداً سابقة حيث كانت النوى تقرأ ذاكرة التخزين المؤقت الكاملة للـ KV. ومن خلال التقسيم بناءً على رؤوس الـ KV عندما يكون العدد قابلاً للقسمة على عدد النوى، تقرأ كل نواة فقط الجزء المحدد الخاص بها من ذاكرة التخزين المؤقت للـ KV، مما يستعيد فوائد عرض النطاق الترددي للذاكرة.

  • يزداد سرعة الاستدلال لـ Qwen3-0.6B من 6977 إلى 11026 رمز/ثانية (+58%) عند استخدام 4 نوى مع تقسيم الصفوف.
  • يرتفع أداء llama-3.2-3B من 3717 إلى 5522 رمز/ثانية (+49%).
  • يشهد Qwen3.5-4B مكسباً طفيفاً بنسبة 4%، بينما لا يظهر Gemma-4 MoE أي تغيير بسبب هيمنة طبقة FFN في بنية MoE.
  • يتم التحكم في هذه الميزة عبر المتغير GGML_HEXAGON_FA_HEAD_SPLIT، وينتقل إلى تقسيم كتل الرموز عندما لا تكون أعداد الرؤوس قابلة للقسمة على عدد النوى.

يُسرّع هذا التحسين بشكل كبير معدل الإنتاجية أثناء مرحلة الحشو (prefill) لتكوينات نماذج محددة على عتاد Hexagon.