El backend de hexagon actualiza flash attention para utilizar una partición paralela por cabezas en la ejecución multicore dividida por filas, abordando una limitación previa donde los núcleos leían toda la caché KV. Al particionar por cabezas KV cuando es divisible por el número de núcleos, cada núcleo lee solo su fragmento específico de la caché KV, restaurando los beneficios del ancho de banda de memoria.

  • La velocidad de inferencia de Qwen3-0.6B aumenta de 6977 a 11026 tokens/s (+58%) con división por filas en 4c.
  • El rendimiento de llama-3.2-3B sube de 3717 a 5522 tokens/s (+49%).
  • Qwen3.5-4B experimenta una ganancia menor del 4%, mientras que Gemma-4 MoE no muestra cambios debido a la dominancia de FFN en MoE.
  • La función se controla mediante GGML_HEXAGON_FA_HEAD_SPLIT y vuelve a la división por bloques de tokens cuando los conteos de cabezas no son divisibles por el número de núcleos.

Esta optimización acelera significativamente el rendimiento de prellenado para configuraciones específicas de modelos en hardware Hexagon.