llama.cpp プロジェクトはバージョン b10907 をリリースし、マルチトークン予測 (MTP) コンテキストキーバリューキャッシュの割り当てに関する修正を含んでいます。このアップデートは、deepseek2、glm4moe、cohere2moe のアーキテクチャに影響を与える問題を解決します。
- deepseek2、glm4moe、cohere2moe モデルの MTP コンテキスト kv キャッシュ割り当てを修正。
- MTP レイヤーフィルタリング用の逆アーキテクチャゲーティングと包括的なアーキテクチャテストを追加。
- NextN フィルターコメントを簡素化し、test-llama-archs の変更を削除。
リリースでは、macOS (Apple Silicon および Intel)、iOS、Linux (CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows (CPU、CUDA、OpenCL、Vulkan、OpenVINO、SYCL、ROCm)、openEuler 用のバイナリが提供されます。