El proyecto llama.cpp lanzó la compilación b10434, que añade soporte para pasar el parámetro `reasoning_effort` a las plantillas Jinja. Este cambio asegura que los valores de `reasoning_effort` de OpenAI Chat Completions se almacenen y estén disponibles durante la generación.
- El servidor ahora lee correctamente `reasoning_effort` del cuerpo de la solicitud.
- La lógica de conversión de la API de respuestas maneja el mapeo de `reasoning.effort` a `reasoning_effort`.
- El parámetro se expone en `generation_params` y se posiciona junto a `enable_thinking`.
- El contexto se pasa a través de la función analyze para reflejar el comportamiento de `preserve_reasoning`.
Esta actualización permite a los usuarios controlar directamente los niveles de esfuerzo de razonamiento a través de las entradas de la plantilla, facilitando una configuración más granular de los parámetros de inferencia del modelo.