llama.cpp プロジェクトはビルド b11043 をリリースし、HMX flash-attention 実装への変更を含んでいます。このアップデートは 64 の倍数ではないヘッド次元のサポートを有効にし、特に SigLIP の head_dim=72 などの構成を許可します。
- HMX flash-attention カーネルは現在、DK/DV を 64 に切り上げた上でゼロ埋めされたテールレーンで動作します。
- macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL)、Windows (CPU、OpenCL、CUDA、Vulkan、OpenVINO、SYCL、ROCm)、Android、および openEuler 用のビルド済みバイナリが利用可能です。
この変更により、ユーザーは互換性の問題なく、対応ハードウェア上で非標準のヘッド次元を持つモデルを実行できます。