Le projet llama.cpp a publié la compilation b10353, qui traite d'un bug critique dans l'opération ggml_roll sur les backends CUDA et Metal. Auparavant, les tenseurs source permutés (non contigus) produisaient silencieusement des résultats incorrects car ces backends ignoraient les informations de stride.
- La correction ajoute une exigence de source contiguë aux noyaux roll CUDA et Metal, correspondant à la protection GGML_OP_ROPE existante.
- Ce changement garantit que l'ordonnanceur revient à l'implémentation CPU pour les entrées non contiguës, qui gère correctement les strides.
- Un cas de test_roll permuté a été ajouté pour vérifier la correction.
Cette mise à jour empêche la corruption des données dans les modèles dépendant d'opérations ROLL avec des layouts de mémoire non standard.