O backend hexagon atualiza o flash attention para usar particionamento paralelo por cabeçote na execução multicore com divisão de linhas, corrigindo uma limitação anterior em que os núcleos liam todo o cache KV. Ao particionar pelos cabeçotes KV quando divisível pelo número de núcleos, cada núcleo lê apenas sua fatia específica do cache KV, restaurando os benefícios da largura de banda de memória.
- A velocidade de inferência do Qwen3-0.6B aumenta de 6977 para 11026 tokens/s (+58%) com divisão de linhas em 4 núcleos.
- O desempenho do llama-3.2-3B sobe de 3717 para 5522 tokens/s (+49%).
- O Qwen3.5-4B apresenta um ganho menor de 4%, enquanto o Gemma-4 MoE não mostra mudança devido à dominância do FFN MoE.
- O recurso é controlado por GGML_HEXAGON_FA_HEAD_SPLIT e recua para divisão em blocos de tokens quando as contagens de cabeçotes não são divisíveis pelo número de núcleos.
Esta otimização acelera significativamente a taxa de preenchimento inicial (prefill) para configurações específicas de modelos no hardware Hexagon.