Local inference
github llama.cpp · il y a 8 j · 10 vues

llama.cpp b10219 persiste reasoning_content dans l'historique de chat

Le projet llama.cpp a publié la version b10219, qui inclut une correction pour le CLI afin de persister le contenu du raisonnement dans l'historique de chat. Auparavant, bien que `llama-cli` collecte le raisonnement du flux pour l'affichage, il ne stockait que le contenu de l'assistant dans les messages, empêchant le drapeau `--reasoning-preserve` de réinjecter les pensées précédentes lors des tours suivants.