Proyek llama.cpp telah merilis build b10182, yang mencakup perubahan struktural dalam cara penekanan token dikelola. Modifikasi utama melibatkan memindahkan logika penanganan `suppress_tokens` ke modul `common/sampling`.

  • Fitur `has_logit_bias` telah dihapus dari basis kode.
  • Rilis ini mengatasi masalah keamanan yang terkait dengan implementasi sebelumnya.
  • Binari disediakan untuk macOS (Apple Silicon dan Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO, SYCL, HIP), dan openEuler.

Pembaruan ini mengonsolidasikan logika pengambilan sampel dan menyelesaikan masalah keamanan tertentu dalam mekanisme penekanan token.