Le projet llama.cpp a publié la compilation b10701, qui inclut une correction pour les modèles ébauche DFlash2 NVFP4. La mise à jour résout un problème où ces modèles produisaient presque aucun jeton spéculatif accepté.

  • Transmet les échelles NVFP4 manquantes aux opérations d'attention dans la pull request #28000.
  • Garantit que les échelles de projection Q, K, V et de sortie sont correctement transmises aux opérations de graphe correspondantes.

Cette modification restaure le fonctionnement correct des modèles DFlash2 NVFP4 en corrigeant la propagation des échelles requise pour le décodage spéculatif.