Backend hexagon memperbarui flash attention untuk menggunakan partisi head-paralel guna eksekusi multicore dengan split baris, mengatasi keterbatasan sebelumnya di mana inti membaca seluruh cache KV. Dengan melakukan partisi berdasarkan kepala KV ketika dapat dibagi oleh jumlah inti, setiap inti hanya membaca sharding spesifiknya dari cache KV, sehingga mengembalikan manfaat bandwidth memori.

  • Kecepatan inferensi Qwen3-0.6B meningkat dari 6977 menjadi 11026 tok/s (+58%) pada split baris 4c.
  • Kinerja llama-3.2-3B naik dari 3717 menjadi 5522 tok/s (+49%).
  • Qwen3.5-4B mengalami peningkatan minor sebesar 4%, sementara Gemma-4 MoE tidak menunjukkan perubahan karena dominasi FFN MoE.
  • Fitur ini dikendalikan oleh GGML_HEXAGON_FA_HEAD_SPLIT dan beralih ke partisi blok token ketika jumlah kepala tidak dapat dibagi oleh jumlah inti.

Optimisasi ini secara signifikan mempercepat throughput prefill untuk konfigurasi model tertentu pada perangkat keras Hexagon.