La versión llama.cpp b10728 introduce una implementación de CUDA para el XOR swizzle de los tiles fp16 K,V de memoria compartida de Flash Attention. Esta actualización también resuelve una condición de carrera en la memoria compartida de Flash Attention en hardware DGX Spark.

  • Implementa flash attention con XOR swizzle y tiles fp16 para CUDA.
  • Corrige el uso de un puntero genérico de 64 bits en lugar de un puntero compartido de 32 bits.
  • Añade casos de prueba para swizzle y limita la sincronización solo a la ruta con swizzle.
  • Permite el swizzling para formas que no son potencias de 2 donde nbatch_2%32==0.
  • Refactoriza la lógica ldmatrix del swizzle de Flash Attention en funciones auxiliares.

La versión proporciona binarios para macOS, Linux, Windows, Android y openEuler a través de los backends CPU, CUDA, Vulkan, ROCm, OpenVINO y SYCL.