Local inference
github llama.cpp · há 8 d · 10 visualizações

llama.cpp b10219 persiste reasoning_content no histórico de chat

O projeto llama.cpp lançou a versão b10219, que inclui uma correção para o CLI para persistir o conteúdo do raciocínio dentro do histórico de chat. Anteriormente, embora o `llama-cli` coletasse o raciocínio do stream para exibição, ele armazenava apenas o conteúdo do assistente nas mensagens, impedindo que a flag `--reasoning-preserve` re-injetasse pensamentos anteriores em rodadas posteriores.