O projeto llama.cpp lançou a compilação b10434, que adiciona suporte para passar o parâmetro `reasoning_effort` para os templates Jinja. Esta alteração garante que os valores de `reasoning_effort` do OpenAI Chat Completions sejam armazenados e disponibilizados durante a geração.
- O servidor agora lê corretamente `reasoning_effort` do corpo da solicitação.
- A lógica de conversão da API de respostas lida com o mapeamento de `reasoning.effort` para `reasoning_effort`.
- O parâmetro é exposto em `generation_params` e posicionado ao lado de `enable_thinking`.
- O contexto é passado pela função analyze para espelhar o comportamento de `preserve_reasoning`.
Esta atualização permite que os usuários controlem diretamente os níveis de esforço de raciocínio por meio das entradas do template, facilitando uma configuração mais granular dos parâmetros de inferência do modelo.