llama.cpp プロジェクトはバージョン b10669 をリリースし、oneDNN SDPA パスのパフォーマンス最適化として、f16 KV キャッシュをその場でバインドする機能を含めています。
- この変更により、プリフィルチャンク中のメモリトラフィックが削減されます。例えば、Qwen3.8 27B でライブ KV 長が 34816 の場合、段階的なコピーを避けることで、ubatch あたりのトラフィックを 4.56 GB からさらに低減します。
- バイナリは macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)、openEuler で利用可能です。
このアップデートにより、広範なプラットフォーム互換性を維持しつつ、対応ハードウェア上で最適化された推論パフォーマンスがユーザーに提供されます。