Le projet llama.cpp a publié la version b10431, qui introduit le support du rollback de l'état récurrent (RS) dans l'opération ggml_ssm_scan. Ce changement permet le rollback RS pour les modèles Nemotron sur les backends CPU et CUDA.

  • Implémentation initiale du rollback d'état récurrent pour Nemotron sur CPU et CUDA.
  • Support de K > 1 dans ssm_scan sur tous les backends.
  • Remplacement de la détection statique de CUDA par une API fused_op au moment de l'exécution pour vérifier le support des opérations.
  • Retour à CPU lorsque le backend ne prend pas en charge le rollback SSM.
  • Ajout de test-backend-ops pour CPU et CUDA afin de vérifier la fonctionnalité.

Cette mise à jour permet aux utilisateurs d'exécuter des modèles Nemotron avec des capacités de rollback d'état récurrent sur des configurations matérielles prises en charge.