hexagon 后端更新 flash attention,以在行分割多核执行中使用头并行分区,解决此前核心读取完整 KV 缓存的限制。当可被核心数整除时按 KV 头进行分区,每个核心仅读取其特定的 KV 缓存分片,恢复内存带宽优势。
- Qwen3-0.6B 在 4c 行分割下的推理速度从 6977 提升至 11026 tokens/s(+58%)。
- llama-3.2-3B 性能从 3717 提升至 5522 tokens/s(+49%)。
- Qwen3.5-4B 仅获得 4% 的微小提升,而 Gemma-4 MoE 因 MoE FFN 占主导而无变化。
- 该功能由 GGML_HEXAGON_FA_HEAD_SPLIT 控制,当头数量不能被核心数整除时回退至 token-block 分区。
此优化显著加速了 Hexagon 硬件上特定模型配置的预填充吞吐量。