llama.cpp プロジェクトはビルド b10434 をリリースし、`reasoning_effort` パラメータを Jinja テンプレートに渡すサポートを追加しました。この変更により、OpenAI Chat Completions の `reasoning_effort` 値が保存され、生成中に利用可能になります。

  • サーバーはリクエストボディから `reasoning_effort` を正しく読み取るようになりました。
  • Responses API の変換ロジックは `reasoning.effort` から `reasoning_effort` へのマッピングを処理します。
  • パラメータは `generation_params` で公開され、`enable_thinking` の隣に配置されています。
  • コンテキストは analyze 関数を通じて渡され、`preserve_reasoning` の動作を反映します。

この更新により、ユーザーはテンプレート入力を通じて推論努力レベルを直接制御でき、モデル推論パラメータのより詳細な構成が可能になります。