Проект llama.cpp выпустил сборку b10434, которая добавляет поддержку передачи параметра `reasoning_effort` в шаблоны Jinja. Это изменение гарантирует, что значения `reasoning_effort` из OpenAI Chat Completions сохраняются и становятся доступными во время генерации.

  • Сервер теперь корректно считывает `reasoning_effort` из тела запроса.
  • Логика преобразования Responses API обрабатывает отображение `reasoning.effort` в `reasoning_effort`.
  • Параметр доступен в `generation_params` и расположен рядом с `enable_thinking`.
  • Контекст передаётся через функцию analyze для отражения поведения `preserve_reasoning`.

Это обновление позволяет пользователям напрямую управлять уровнем усилий на рассуждения через входные данные шаблонов, обеспечивая более тонкую настройку параметров вывода модели.