llama.cpp プロジェクトはバージョン b10615 をリリースし、Metal バックエンド向けの per-device tuned quantized (Q, NE) flash-attention ベクトル演算を導入しました。

  • f16 flash-attn ベクトルのインスタンス化を 53 件追加し、合計を 80 から 133 に増加させました。
  • shared memory capacity fallback を備えた tuning table と dispatch wiring を実装しました。
  • quantized KV caches のサポートのためにベクトルチューニングを拡張しました。
  • M1 Pro、M2 Ultra、および M5 Max デバイスのための tuned パラメータを含めました。

このアップデートは、Metal バックエンドに特定のチューニング結果を適用することで、Apple Silicon ハードウェアのパフォーマンスを最適化します。