Le projet llama.cpp a publié la version b11335, qui inclut une optimisation CUDA pour les GPU Volta. La mise à jour dirige l'architecture sm_70 vers la table nwarps Turing MMVQ existante au lieu de tomber dans la configuration générique.

  • Volta (sm_70) utilise désormais le réglage TURING pour le décodage batch-1 de K-quant, modifiant le nombre de warps de 4 à 2.
  • Les benchmarks sur une Tesla V100 avec Qwen3.8-27B montrent une augmentation du débit de +3.17% (+1.091 t/s) avec une perplexité identique au niveau des bits.
  • Le changement est dérivé du fork anyei/llamacpp-v100 et s'applique aux sélecteurs de table du périphérique et de l'hôte.

Cet ajustement améliore la vitesse d'inférence sur le matériel Volta sans affecter la précision du modèle.