hexagon 백엔드는 flash attention을 업데이트하여 행 분할 멀티코어 실행에 head-parallel partitioning을 사용하며, 이전 코어가 전체 KV 캐시를 읽어야 했던 한계를 해결했습니다. 코어 수로 나누어떨어질 때 KV 헤드를 기준으로 파티셔닝함으로써 각 코어는 KV 캐시의 특정 샤드만 읽게 되어 메모리 대역폭 이점을 복원합니다.

  • Qwen3-0.6B 추론 속도가 4c 행 분할에서 초당 6977에서 11026 토큰으로 증가 (+58%).
  • llama-3.2-3B 성능이 초당 3717에서 5522 토큰으로 상승 (+49%).
  • Qwen3.5-4B는 4%의 미미한 이득을 보이며, Gemma-4 MoE는 MoE FFN 우세로 인해 변화가 없습니다.
  • 이 기능은 GGML_HEXAGON_FA_HEAD_SPLIT에 의해 제어되며, 헤드 수가 코어 수로 나누어떨어지지 않을 때 토큰 블록 분할로 폴백됩니다.

이 최적화는 Hexagon 하드웨어에서 특정 모델 구성의 prefill 처리량을 크게 가속화합니다.