Le projet llama.cpp a publié la compilation b10434, qui ajoute le support pour transmettre le paramètre `reasoning_effort` aux modèles Jinja. Ce changement garantit que les valeurs de `reasoning_effort` d'OpenAI Chat Completions sont stockées et disponibles pendant la génération.
- Le serveur lit maintenant correctement `reasoning_effort` dans le corps de la requête.
- La logique de conversion de l'API Responses gère le mappage de `reasoning.effort` vers `reasoning_effort`.
- Le paramètre est exposé dans `generation_params` et positionné à côté de `enable_thinking`.
- Le contexte est transmis via la fonction analyze pour refléter le comportement de `preserve_reasoning`.
Cette mise à jour permet aux utilisateurs de contrôler directement les niveaux d'effort de raisonnement via les entrées du modèle, facilitant une configuration plus granulaire des paramètres d'inférence du modèle.