llama.cpp プロジェクトはバージョン b10206 をリリースし、注意機構におけるキーバリューキャッシュの処理方法に特定の変更を導入しました。この更新により、DeepSeek V4 モデルの K および V キャッシュ型が整合性を持つことが保証されます。
- DeepSeek V4 アーキテクチャに対して同一の K と V キャッシュ型を強制します。
- V キャッシュが量子化されている場合に Flash Attention (FA) を有効にします。
- 他の MLA モデルにも同様の K および V キャッシュ型の強制を適用します。
このリリースでは、CPU、CUDA、ROCm、Vulkan、OpenVINO、SYCL、および OpenCL を含むさまざまなハードウェアバックエンド向けに、macOS、Linux、Windows、Android、openEuler 用のバイナリを提供しています。