O projeto llama.cpp lançou a compilação b10182, que inclui uma mudança estrutural na forma como a supressão de tokens é gerenciada. A modificação principal envolve mover a lógica de tratamento do `suppress_tokens` para o módulo `common/sampling`.

  • O recurso `has_logit_bias` foi removido da base de código.
  • O lançamento aborda problemas de segurança relacionados à implementação anterior.
  • Binários estão disponíveis para macOS (Apple Silicon e Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO, SYCL, HIP) e openEuler.

Esta atualização consolida a lógica de amostragem e resolve preocupações específicas de segurança dentro do mecanismo de supressão de tokens.