llama.cpp 项目发布了构建版本 b10584,解决了一个关键问题:草稿上下文大小与目标上下文不匹配,导致服务器请求因 500 错误而失败。
- 服务器现在确保草稿上下文遵循目标上下文的大小,防止在槽位超出先前限制时发生解码失败。
- 为草稿模型保留的内存以目标可接受的最大上下文进行测量,允许与目标共享单元格的上下文放弃 kv_size 覆盖。
- fit 函数现在考虑一个可选的第二模型,确保在主上下文更改时始终测量其内存,以保持 reduce 路径的精确性。
此更新通过动态对齐草稿和目标上下文大小,解决了服务器部署中的稳定性问题。