Le projet llama.cpp a publié la version b10840, qui introduit des optimisations de performance pour l'inférence CUDA. La mise à jour implémente le calcul sans branchement pour les formats de quantification Q4_K et Q5_K afin d'accélérer la multiplication matrice-vecteur (mmvq).
- Le dépaquetage sans branchement empêche la réexécution de l'échelle pour chaque colonne dans mmvq, améliorant la performance pour des tailles de lot supérieures à 1.
- La logique de prélecture L2 est spécifiquement conditionnée pour le matériel DGX Spark afin de garantir que les gains soient réalisés.
- Le gardien de prélecture L2 de mmvq est étendu pour prendre en charge les backends MUSA et HIP alongside CUDA.
- Les points de commutation pour Q4_K sont mis à jour pour accommoder une gamme plus large de modèles.
Ces changements fournissent des améliorations de performance mesurables pour les utilisateurs exécutant llama.cpp sur des systèmes DGX Spark avec des tailles de lot supérieures à un.