Бэкенд hexagon обновляет flash attention для использования разделения по головам при выполнении с разделением строк на многоядерных процессорах, устраняя предыдущее ограничение, при котором ядра считывали весь KV-кэш. При разделении по головам KV (когда количество кратно числу ядер) каждое ядро читает только свою часть KV-кэша, восстанавливая преимущества пропускной способности памяти.

  • Скорость инференса Qwen3-0.6B увеличивается с 6977 до 11026 токенов/с (+58%) при 4c row-split.
  • Производительность llama-3.2-3B возрастает с 3717 до 5522 токенов/с (+49%).
  • Qwen3.5-4B показывает незначительный рост на 4%, в то время как Gemma-4 MoE не демонстрирует изменений из-за доминирования MoE FFN.
  • Функция управляется флагом GGML_HEXAGON_FA_HEAD_SPLIT и переходит к разделению по блокам токенов, если количество голов не делится на число ядер.

Эта оптимизация значительно ускоряет пропускную способность этапа префилла для определённых конфигураций моделей на оборудовании Hexagon.