llama.cppプロジェクトはビルドb10645をリリースし、新しいコマンドラインオプション --n-cpu-ffn を導入しました。この機能により、ユーザーは密集フィードフォワードネットワーク(FFN)重みをCPUにオフロードするレイヤーの数を指定できます。
- 最初のN層の密集FFN重みのCPUオフロードを制御するために --n-cpu-ffn を追加。
- --n-cpu-moe および --spec-draft-n-cpu-moe オプションのオーバーライドループを重複排除。
- FFN正規表現パターンにわたって llm_ffn_block_regex を汎用化。
本リリースでは、CPU、GPU(CUDA、Vulkan、ROCm、OpenCL)、およびAIアクセラレータバックエンド向けに、macOS、Linux、Windows、Android、openEuler用のバイナリが提供されます。