llama.cpp 项目发布了 b10219 版本,其中包含一个 CLI 修复程序,用于在聊天历史中持久化推理内容。此前,虽然 `llama-cli` 从流中收集推理内容以供显示,但它仅在消息中存储助手内容,导致 `--reasoning-preserve` 标志无法在后续轮次中重新注入之前的思考。

此更新确保推理步骤现在正确保留在消息历史中,使多轮对话能够维持模型内部思维过程的上下文。该版本为 macOS(Apple Silicon 和 Intel)、iOS、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA 12/13、Vulkan、OpenCL、OpenVINO、SYCL、HIP)和 openEuler 提供了二进制文件。

通过修复此持久性问题,用户现在可以有效地使用 `--reasoning-preserve` 选项,在 CLI 交互的多个轮次中延续推理上下文。