llama.cpp 项目发布了构建版本 b10593,解决了与 DeepseekV4 模型架构相关的关键问题。此次更新特别解决了在多重序列处理期间发生的回滚失败问题。
- 修复了 DeepseekV4 对多重序列上下文的回滚处理。
- 修正了通用的模型加载程序。
- 使待处理的回滚操作变为单次使用,以防止状态损坏。
- 确保在全量加载时仅清除特定序列 ID 的缓存。
- 添加了压缩比的断言,并使图拓扑结构保持静态。
此版本提高了运行带有多个序列的 DeepseekV4 模型用户的稳定性。它还提供了适用于 macOS、Linux、Windows、Android 和 iOS 的更新二进制文件,支持包括 CPU、CUDA、ROCm 和 Vulkan 在内的各种硬件后端。