L'implémentation CUDA a été mise à jour pour prioriser les stratégies de planification de tuiles complètes pour FlashAttention. Ce changement vise à optimiser le flux d'exécution des mécanismes d'attention au sein du framework.