El proyecto llama.cpp lanzó la versión b10219, que incluye una corrección para la CLI que permite persistir el contenido del razonamiento dentro del historial de chat. Anteriormente, aunque `llama-cli` recopilaba el razonamiento del stream para su visualización, solo almacenaba el contenido del asistente en los mensajes, lo que impedía que la bandera `--reasoning-preserve` reinyectara los pensamientos previos en turnos posteriores.
Esta actualización asegura que los pasos de razonamiento ahora se retienen correctamente en el historial de mensajes, permitiendo que las conversaciones multironda mantengan el contexto del proceso de pensamiento interno del modelo. El lanzamiento proporciona binarios para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) y openEuler.
Al corregir este problema de persistencia, los usuarios ahora pueden usar eficazmente la opción `--reasoning-preserve` para llevar el contexto del razonamiento a través de múltiples turnos en las interacciones de CLI.