llama.cpp プロジェクトはバージョン b10615 をリリースし、Metal バックエンド向けの per-device tuned quantized (Q, NE) flash-attention ベクトル演算を導入しました。
- f16 flash-attn ベクトルのインスタンス化を 53 件追加し、合計を 80 から 133 に増加させました。
- shared memory capacity fallback を備えた tuning table と dispatch wiring を実装しました。
- quantized KV caches のサポートのためにベクトルチューニングを拡張しました。
- M1 Pro、M2 Ultra、および M5 Max デバイスのための tuned パラメータを含めました。
このアップデートは、Metal バックエンドに特定のチューニング結果を適用することで、Apple Silicon ハードウェアのパフォーマンスを最適化します。