O projeto llama.cpp lançou a compilação b10763, que altera o comportamento padrão do argumento de palavra-chave `preserve_reasoning` do modelo de chat. O servidor agora registra o estado efetivo deste kwarg e emite um aviso quando ele está habilitado por padrão em modelos que o suportam.

  • O método `--chat-template-kwargs` para definir essa opção está obsoleto em favor de sinalizadores explícitos como `--reasoning-preserve` ou `--no-reasoning-preserve`.
  • Binários pré-compilados estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm 7.14, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm 7.14) e openEuler.
  • A versão inclui binários de UI para todas as plataformas suportadas.