llama.cpp 프로젝트는 `reasoning_effort` 매개변수를 Jinja 템플릿으로 전달하는 지원을 추가한 빌드 b10434를 출시했습니다. 이 변경으로 OpenAI Chat Completions의 `reasoning_effort` 값이 저장되고 생성 동안 사용 가능해집니다.
- 서버가 이제 요청 본문에서 `reasoning_effort`를 올바르게 읽습니다.
- Responses API 변환 로직이 `reasoning.effort`를 `reasoning_effort`로 매핑합니다.
- 이 매개변수는 `generation_params`에 노출되며 `enable_thinking` 옆에 위치합니다.
- 컨텍스트는 analyze 함수를 통해 전달되어 `preserve_reasoning` 동작을 반영합니다.
이 업데이트를 통해 사용자는 템플릿 입력을 통해 추론 노력 수준을 직접 제어할 수 있으며, 모델 추론 매개변수의 더 세분화된 구성이 가능해집니다.