Local inference
github llama.cpp · hace 8 d · 10 vistas

llama.cpp b10219 persiste reasoning_content en el historial de chat

El proyecto llama.cpp lanzó la versión b10219, que incluye una corrección para la CLI que permite persistir el contenido del razonamiento dentro del historial de chat. Anteriormente, aunque `llama-cli` recopilaba el razonamiento del stream para su visualización, solo almacenaba el contenido del asistente en los mensajes, lo que impedía que la bandera `--reasoning-preserve` reinyectara los pensamientos previos en turnos posteriores.