Le projet llama.cpp a publié la version b10431, qui introduit le support du rollback de l'état récurrent (RS) dans l'opération ggml_ssm_scan. Ce changement permet le rollback RS pour les modèles Nemotron sur les backends CPU et CUDA.
- Implémentation initiale du rollback d'état récurrent pour Nemotron sur CPU et CUDA.
- Support de K > 1 dans ssm_scan sur tous les backends.
- Remplacement de la détection statique de CUDA par une API fused_op au moment de l'exécution pour vérifier le support des opérations.
- Retour à CPU lorsque le backend ne prend pas en charge le rollback SSM.
- Ajout de test-backend-ops pour CPU et CUDA afin de vérifier la fonctionnalité.
Cette mise à jour permet aux utilisateurs d'exécuter des modèles Nemotron avec des capacités de rollback d'état récurrent sur des configurations matérielles prises en charge.