llama.cpp 项目发布了构建版本 b10434,增加了对将 `reasoning_effort` 参数传递到 Jinja 模板的支持。此更改确保 OpenAI Chat Completions 的 `reasoning_effort` 值在生成期间被存储并可访问。

  • 服务器现在正确从请求体中读取 `reasoning_effort`。
  • Responses API 转换逻辑处理将 `reasoning.effort` 映射到 `reasoning_effort`。
  • 该参数在 `generation_params` 中暴露,并位于 `enable_thinking` 旁边。
  • 上下文通过 analyze 函数传递,以镜像 `preserve_reasoning` 的行为。

此更新允许用户直接通过模板输入控制推理努力级别,从而实现模型推理参数的更细粒度配置。