Проект llama.cpp выпустил сборку b10434, которая добавляет поддержку передачи параметра `reasoning_effort` в шаблоны Jinja. Это изменение гарантирует, что значения `reasoning_effort` из OpenAI Chat Completions сохраняются и становятся доступными во время генерации.
- Сервер теперь корректно считывает `reasoning_effort` из тела запроса.
- Логика преобразования Responses API обрабатывает отображение `reasoning.effort` в `reasoning_effort`.
- Параметр доступен в `generation_params` и расположен рядом с `enable_thinking`.
- Контекст передаётся через функцию analyze для отражения поведения `preserve_reasoning`.
Это обновление позволяет пользователям напрямую управлять уровнем усилий на рассуждения через входные данные шаблонов, обеспечивая более тонкую настройку параметров вывода модели.