Реализация CUDA была обновлена, чтобы приоритизировать стратегии планирования целых тайлов для FlashAttention. Это изменение направлено на оптимизацию потока выполнения механизмов внимания в рамках фреймворка.