Proyek llama.cpp merilis build b10434, yang menambahkan dukungan untuk meneruskan parameter `reasoning_effort` ke template Jinja. Perubahan ini memastikan bahwa nilai `reasoning_effort` dari OpenAI Chat Completions disimpan dan tersedia selama generasi.

  • Server sekarang membaca `reasoning_effort` dengan benar dari body permintaan.
  • Logika konversi API Responses menangani pemetaan `reasoning.effort` ke `reasoning_effort`.
  • Parameter ini diekspos di `generation_params` dan diposisikan di sebelah `enable_thinking`.
  • Konteks diteruskan melalui fungsi analyze untuk mencerminkan perilaku `preserve_reasoning`.

Pembaruan ini memungkinkan pengguna mengendalikan tingkat upaya penalaran secara langsung melalui input template, memfasilitasi konfigurasi parameter inferensi model yang lebih granular.