Le projet llama.cpp a publié la version b10534, qui introduit des points de commutation spécifiques au matériel pour ajuster le passage entre les chemins vectoriels et ceux des cœurs tensoriels lors du décodage quantifié sur CUDA.
- La mise à jour ajoute une configuration d'exécution via GGML_CUDA_MMVQ_MAX pour ajuster le seuil de taille de lot où le noyau bascule de mul_mat_vec_q vers MMQ.
- Des valeurs spécifiques pour les points de commutation sont désormais incluses pour les architectures Blackwell, DGX Spark et Ada, réduisant la dépendance aux variables d'environnement.
- La baisse de ce seuil dirige les lots plus importants vers le chemin des cœurs tensoriels int8 MMQ, offrant un gain de vitesse mesuré de 23 à 41 % pour une taille de lot de 8 sur RTX 5090 pour les modèles denses Q4_K.
- La mise à jour inclut des binaires pour macOS, Linux, Windows, Android et openEuler sur les backends CPU, CUDA, Vulkan, ROCm, OpenVINO et SYCL.
Cette amélioration optimise les performances d'inférence sur les GPU NVIDIA modernes en sélectionnant automatiquement le chemin de noyau le plus efficace en fonction de la taille du lot et des capacités matérielles.