llama.cpp 项目发布了 0.4.1 版本,引入了对 CPU 上 Maple 20B-A1B 三元混合专家架构的支持,以及对腾讯 Hy 4 和 Spark2.5 模型的预览支持。
- 新增 Maple 20B-A1B 三元 MoE 架构(CPU)支持。
- 新增腾讯 Hy 4 (hy_v4) 预览架构支持。
- 新增 Spark2.5 模型支持。
- 将 ggml 更新至 v0.24.0,通过新的精度控制 API 扩展后端覆盖范围并增强鲁棒性。
- 通过重构为 common_schema 内部表示,改进了 JSON schema 处理。
- 将专用聊天解析器拆分至 common/parsers,并通过 --log-jsonl 添加结构化 JSONL 日志记录。
- 修复了 DeepSeek2、GLM-MoE 及相关模型的 MTP 上下文 KV 缓存分配问题。
- 修复了受影响的 Qwen/Kimi/GLM 模型中从 max 到 rsqrt 的 GDN 归一化。
此版本支持运行新的模型架构,并通过修正归一化、缓存分配和服务器子进程管理提升了稳定性。