Le projet llama.cpp a publié la version b11007, qui introduit le support des CUDA graphs dans les brouillons de Multi-Token Prediction (MTP). Cette mise à jour améliore l'efficacité du processus de brouillage en tirant parti de l'exécution de CUDA graph.
- Activer CUDA graph pour le brouillon MTP afin d'améliorer l'efficacité d'utilisation.
- Fournir des binaires pour macOS (Apple Silicon et Intel), iOS, Linux (CPU, Vulkan, CUDA 12/13, ROCm, OpenVINO, SYCL), Android, Windows (CPU, OpenCL, CUDA 12/13, Vulkan, OpenVINO, SYCL, ROCm) et openEuler.
- Inclure des binaires d'interface utilisateur pour toutes les plateformes prises en charge.
Cette version permet aux utilisateurs de bénéficier de performances d'inférence optimisées sur les GPU NVIDIA compatibles grâce à la nouvelle implémentation du brouillon MTP.