O projeto llama.cpp lançou a versão b10219, que inclui uma correção para o CLI para persistir o conteúdo do raciocínio dentro do histórico de chat. Anteriormente, embora o `llama-cli` coletasse o raciocínio do stream para exibição, ele armazenava apenas o conteúdo do assistente nas mensagens, impedindo que a flag `--reasoning-preserve` re-injetasse pensamentos anteriores em rodadas posteriores.

Esta atualização garante que os passos de raciocínio agora são corretamente retidos no histórico de mensagens, permitindo que conversas multi-turno mantenham o contexto do processo de pensamento interno do modelo. O lançamento fornece binários para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) e openEuler.

Ao corrigir este problema de persistência, os usuários agora podem usar eficazmente a opção `--reasoning-preserve` para levar adiante o contexto do raciocínio através de múltiplas rodadas nas interações de CLI.