llama.cpp 프로젝트는 채팅 기록 내에서 추론 콘텐츠를 유지하는 CLI 수정 사항을 포함한 버전 b10219를 출시했습니다. 이전에는 `llama-cli`가 스트림에서 추론을 수집하여 표시했지만 메시지에는 어시스턴트 콘텐츠만 저장되어 있어 `--reasoning-preserve` 플래그가 이후 턴에서 이전 생각을 다시 주입하지 못했습니다.

이 업데이트는 이제 추론 단계가 메시지 기록에 올바르게 유지되어 다중 턴 대화에서 모델의 내부 사고 과정의 컨텍스트를 유지할 수 있도록 합니다. 이 릴리스는 macOS (Apple Silicon 및 Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) 및 openEuler에 대한 바이너리를 제공합니다.

이 유지 문제를 수정함으로써 사용자는 이제 CLI 상호 작용에서 여러 턴에 걸쳐 추론 컨텍스트를 계속 전달하기 위해 `--reasoning-preserve` 옵션을 효과적으로 사용할 수 있습니다.