Le projet llama.cpp a publié la version b10242, introduisant un nouvel échantillonneur de backend pour les pénalités qui permet de décharger le traitement des pénalités vers le GPU. Ce changement améliore la fonction `common_sampler_init` et met à jour la structure `llama_sampler_penalties` pour qu'elle hérite de `llama_sampler_backend`, permettant des ajustements de fréquence et de présence sur le backend.
- L'implémentation inclut la logique d'initialisation du backend, l'application des pénalités et le support des pénalités top-k dans l'échantillonnage du backend.
- La stabilité numérique est améliorée en conservant les logits masqués à -Inf pour empêcher la génération de NaN lors de l'échantillonnage.
- La validation assure que les valeurs de pénalité de répétition sont finies et supérieures à 0, avec des tests ajoutés pour les paramètres invalides.
- La version fournit des binaires pour macOS (Apple Silicon et Intel), Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenCL, HIP, OpenVINO, SYCL) et les architectures openEuler.