llama.cpp 项目已添加对 GLM-5.3-Flash (GLM5-Next) 模型架构的初步支持,包括迁移到混合索引内存以及早期的多令牌预测 (MTP) 功能。
- 添加了初步的 MTP 支持,但为了允许集中审查,在初始 pull request 中将其剥离。
- k-pool 布局现在在 ubatches 之间保持,以防止序列编辑和共享拆除后的陈旧问题。
- 循环回滚检查点正确写入 conv 状态和 delta net 状态。
- 修复了 build_attn_mha 流步长中的错误,针对非连续查询,确保 GLM5-Next 的多流预填充正确。
- 清理了量化保护过滤器以删除重复条目。
这些更改确保了在各种硬件后端(包括 CUDA、ROCm 和 CPU)上 GLM5-Next 模型的稳定推理和正确的状态管理。