Le projet llama.cpp a publié la version b10951, qui inclut une optimisation du code dans la logique de décodage. L'appel à la fonction `llama_n_rs_seq` est maintenant exécuté avant `llama_decode`, permettant au système de retourner directement si la vérification réussit.
- Ce changement élimine le besoin de définir la variable `res` et d'utiliser une instruction goto lorsque la condition de retour anticipé est remplie.
- La motivation principale est d'évoker l'appel à `llama_decode` lorsqu'il n'est pas nécessaire, améliorant ainsi l'efficacité.
- Les binaires sont disponibles pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, ROCm, OpenVINO, SYCL), Android, Windows (CPU, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.