Le projet llama.cpp a publié la version b10182, qui inclut un changement structurel dans la gestion de la suppression des tokens. La modification principale consiste à déplacer la logique de traitement de `suppress_tokens` dans le module `common/sampling`.

  • La fonctionnalité `has_logit_bias` a été supprimée du code source.
  • Cette version résout les problèmes de sécurité liés à l'implémentation précédente.
  • Des binaires sont fournis pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, ROCm, OpenVINO, SYCL, HIP) et openEuler.

Cette mise à jour consolide la logique d'échantillonnage et résout des problèmes de sécurité spécifiques au sein du mécanisme de suppression de tokens.