Le projet llama.cpp a publié la version b10219, qui inclut une correction pour le CLI afin de persister le contenu du raisonnement dans l'historique de chat. Auparavant, bien que `llama-cli` collecte le raisonnement du flux pour l'affichage, il ne stockait que le contenu de l'assistant dans les messages, empêchant le drapeau `--reasoning-preserve` de réinjecter les pensées précédentes lors des tours suivants.
Cette mise à jour garantit que les étapes de raisonnement sont désormais correctement conservées dans l'historique des messages, permettant aux conversations multi-tours de maintenir le contexte du processus de pensée interne du modèle. La version fournit des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, OpenVINO, SYCL, HIP) et openEuler.
En corrigeant ce problème de persistance, les utilisateurs peuvent désormais utiliser efficacement l'option `--reasoning-preserve` pour transmettre le contexte du raisonnement à travers plusieurs tours dans les interactions CLI.