llama.cpp プロジェクトはビルド b10434 をリリースし、`reasoning_effort` パラメータを Jinja テンプレートに渡すサポートを追加しました。この変更により、OpenAI Chat Completions の `reasoning_effort` 値が保存され、生成中に利用可能になります。
- サーバーはリクエストボディから `reasoning_effort` を正しく読み取るようになりました。
- Responses API の変換ロジックは `reasoning.effort` から `reasoning_effort` へのマッピングを処理します。
- パラメータは `generation_params` で公開され、`enable_thinking` の隣に配置されています。
- コンテキストは analyze 関数を通じて渡され、`preserve_reasoning` の動作を反映します。
この更新により、ユーザーはテンプレート入力を通じて推論努力レベルを直接制御でき、モデル推論パラメータのより詳細な構成が可能になります。