La implementación de CUDA se ha actualizado para priorizar las estrategias de programación de tiles completos para FlashAttention. Este cambio tiene como objetivo optimizar el flujo de ejecución de los mecanismos de atención dentro del marco.