llama.cpp 项目发布了构建版本 b10645,引入了新的命令行选项 --n-cpu-ffn。此功能允许用户指定将其密集前馈网络 (FFN) 权重卸载到 CPU 的层数。
- 添加 --n-cpu-ffn 以控制前 N 层的密集 FFN 权重的 CPU 卸载。
- 对 --n-cpu-moe 和 --spec-draft-n-cpu-moe 选项的重写循环进行去重。
- 将 llm_ffn_block_regex 泛化到 FFN 正则表达式模式上。
该版本为 macOS、Linux、Windows、Android 和 openEuler 提供了适用于 CPU、GPU (CUDA, Vulkan, ROCm, OpenCL) 和 AI 加速器后端的二进制文件。