hexagonバックエンドは、行分割マルチコア実行のためにヘッド並列パーティショニングを使用するようにフラッシュアテンションを更新し、コアがKVキャッシュ全体を読み取るという以前の制限に対処しました。コア数で割り切れる場合、KVヘッドでパーティショニングすることで、各コアはKVキャッシュの特定のシャードのみを読み取り、メモリ帯域幅の恩恵を回復します。

  • 4c行分割において、Qwen3-0.6Bの推論速度が6977から11026 tok/sに向上(+58%)。
  • llama-3.2-3Bのパフォーマンスが3717から5522 tok/sに上昇(+49%)。
  • Qwen3.5-4Bはわずかな4%の増加を示しますが、Gemma-4 MoEはMoE FFNの支配により変化なし。
  • この機能はGGML_HEXAGON_FA_HEAD_SPLITによって制御され、ヘッド数がコア数で割り切れない場合はトークンブロック分割にフォールバックします。

この最適化により、Hexagonハードウェア上の特定のモデル構成においてプレフィルスループスが大幅に加速されます。